斯坦福实验实锤: 魔改后的DS V4 Flash干翻Fable 5
斯坦福实验实锤: 魔改后的DS V4 Flash干翻Fable 5同样的模型,同样的任务,让它执行五遍,再让他自己挑一遍最稳的,效果能有多大提升?斯坦福把这套玩法用在了AI身上,DeepSeek V4 Flash在Terminal-Bench 2.1的成绩从79%一路涨到88%,反超了尖子生Fable 5。而且连做五遍加挑选这一通折腾,价格依然比Fable 5便宜了4-11倍。
搜索
同样的模型,同样的任务,让它执行五遍,再让他自己挑一遍最稳的,效果能有多大提升?斯坦福把这套玩法用在了AI身上,DeepSeek V4 Flash在Terminal-Bench 2.1的成绩从79%一路涨到88%,反超了尖子生Fable 5。而且连做五遍加挑选这一通折腾,价格依然比Fable 5便宜了4-11倍。
今年8月,谷歌首席科学家Jeff Dean宣布离职,创办AI4S公司Discovery Loop。
真正的智能,在于能否基于有限的数据,实现可靠的泛化与迁移。
香港大学、香港科技大学与腾讯 ARC Lab 联合提出 SCoPE(Sightline-Coordinate Positional Encoding),一套面向视频 DiT 的射线空间位置编码:让视频模型处理位置关系的基底从张量网格转向射线空间。
训练一切AI的算法,被AI自己判了「死刑」?就在最近,清华大学和宾大沃顿商学院的两位研究者挂出一篇新论文,给了一个优化理论界等了40年的结论——梯度下降想跑到最快,光调步长没用。
JiuwenBox 的定位,可以用一个比喻说清:给 AI 干活的临时房间。它和 WorkSwarm 是这么配合的:用户在 WorkSwarm 里发一个任务,Agent 负责把任务想清楚、拆成几步;每一步要跑的命令、要运行的代码、要碰的文件,统统送进 JiuwenBox 的沙箱去执行。Agent 负责 "出主意",沙箱负责 "安全地动手"。
在 action chunking 已成为 VLA 标配的今天,「一次执行多少步」几乎被所有工作当作一个固定的超参数。
当自动驾驶赛车以近 300 km/h 的时速在 F1 赛道上与周车进攻防守、交互博弈,它面对的问题早已不只是提升圈速。
今天的视频生成模型,已经越来越像一个会拍电影的导演。
十多年前,Ilya Sutskever 说过这么一句话。 「模型就是想学习。」