北大联合阶跃星辰提出TensorCast:统一可编程管理大模型张量,推理「首字延迟」最高降低93.2%
北大联合阶跃星辰提出TensorCast:统一可编程管理大模型张量,推理「首字延迟」最高降低93.2%过去几年,大模型推理系统优化的核心目标一直围绕一个问题展开:如何让 GPU 更高效地计算权重、激活、KV Cache 等高维张量?从并行策略、请求调度、显存管理到算子优化,学界业界大量优化技术不断提升模型推理效率。
搜索
过去几年,大模型推理系统优化的核心目标一直围绕一个问题展开:如何让 GPU 更高效地计算权重、激活、KV Cache 等高维张量?从并行策略、请求调度、显存管理到算子优化,学界业界大量优化技术不断提升模型推理效率。
当机器人把书放进抽屉,它看到的是一串二维图像,然而真正需要完成的,却是一段发生在三维空间、持续随时间演化的动作。
AI的“情绪”也会影响工作状态?
今日零时起,DeepSeek正式执行新版API价格,DeepSeek-V4-Flash和DeepSeek-V4-Pro两款主力模型首次采用峰谷定价,闲时价格统一为高峰时段的一半。此次调整同步抬高了两款模型的基础价格。DeepSeek-V4-Flash高峰时段每百万Tokens缓存命中输入、缓存未命中输入和输出价格分别为0.1元、3元和9元,闲时分别降至0.05元、1.5元和4.5元。
随着Agent走向真实工作,后训练和数据正在成为提升智能的关键。
上周一,我发了自己做的AIHOT大模型排行榜。
预计半年内,ChatGPT的下一代模型将能监视你的屏幕、记录每一次会议与通话,并完整掌握关于你生活的全部上下文。
最近,葬AI和我们的朋友钟经纬、正阳一起,推出了懂模帝这个产品,现在任何人都可以登陆 fuckai.md 去看各种各样的benchmark。
请想象这样一种居家场景:当你戴着 AI 眼镜在厨房准备晚饭,用刀切菜时,它会立刻提醒你注意安全;当你连续几天形成举着手机长时间录像的习惯时,它会主动建议你换一种更省力的记录方式。
毫无疑问,四月份发布的生图模型 GPT-Image-2,现在依然是当之无愧的 AI 生图之王。