斯坦福教授直播训练535B大模型,模型训练背后的「黑箱」正在被打开?
斯坦福教授直播训练535B大模型,模型训练背后的「黑箱」正在被打开?最近两天,X 上网友 Max For AI@MaxForAI 的一篇帖子引发了网友热议:「太疯狂了 —— 现在你甚至可以直播围观一个 535B 大模型是如何被训练出来的。」
搜索
最近两天,X 上网友 Max For AI@MaxForAI 的一篇帖子引发了网友热议:「太疯狂了 —— 现在你甚至可以直播围观一个 535B 大模型是如何被训练出来的。」
同样的模型,同样的任务,让它执行五遍,再让他自己挑一遍最稳的,效果能有多大提升?斯坦福把这套玩法用在了AI身上,DeepSeek V4 Flash在Terminal-Bench 2.1的成绩从79%一路涨到88%,反超了尖子生Fable 5。而且连做五遍加挑选这一通折腾,价格依然比Fable 5便宜了4-11倍。
今年8月,谷歌首席科学家Jeff Dean宣布离职,创办AI4S公司Discovery Loop。
近来文生图模型发展迅速,但每篇工作多是独立地引入一整套模型、数据和训练设计,然后用私有的数据训出来了一个亮眼的模型。
真正的智能,在于能否基于有限的数据,实现可靠的泛化与迁移。
自打AI内容生成出现,到现在,已经快3年了。上半场大家比的是谁更会用AI生成内容。现在到了下半场,已经是各家公司开始比谁能用AI来防AI内容了。后面,你会看到一个魔幻的场面:平台先花费重金训练AI,用AI生成海量内容。
香港大学、香港科技大学与腾讯 ARC Lab 联合提出 SCoPE(Sightline-Coordinate Positional Encoding),一套面向视频 DiT 的射线空间位置编码:让视频模型处理位置关系的基底从张量网格转向射线空间。
AI 催生了许多新产业,今天分享的就是其中之一。今年5月,一名来自 WIRED 的记者做了一个有点奇怪的兼职。他把 iPhone 固定在头上,确保镜头能拍到自己的两只手,然后开始录自己:不是为了拍短视频。
训练一切AI的算法,被AI自己判了「死刑」?就在最近,清华大学和宾大沃顿商学院的两位研究者挂出一篇新论文,给了一个优化理论界等了40年的结论——梯度下降想跑到最快,光调步长没用。
新智元报道 Anthropic「巴拿马计划」曝光了! 2024年4月13日,Anthropic内部传阅了一份文档。 里面有这么一句:我们用一个「软代号」,因为不想让人知道我们在做这件事。 代号叫巴拿马