震撼,谷歌破解了RSI?AI靠「做梦」学会无限进化
震撼,谷歌破解了RSI?AI靠「做梦」学会无限进化谷歌,可能已经破解了RSI!
搜索
谷歌,可能已经破解了RSI!
一笔融资、一份技术报告,让一个过去五年鲜少公开发声的团队,逐渐显露出更完整的面貌。
9 月 3 日,OpenAI 正式发布 GPT-6 Astra。在 ARC-AGI-3(一个考验 AI 能否在陌生环境中自主探索、理解规则并规划行动的 Benchmark),Astra 拿下 99.9%,并在 96% 的关卡中达到或超过人类的行动效率基准。
最近Seed-2.1-pro又更新了。
RSI,彻底火了。
真实世界的时间序列,不仅被外部事件冲击,也被人为决策持续重塑。
大模型 Agent 进入浏览器、邮件、数据库和业务系统后,安全评估如果仍只检查最终回复是否包含有害内容,覆盖面会明显不足。Agent 需要规划步骤、读取外部信息并调用工具,风险可能出现在执行过程中的任一环节。
前不久,微信视觉团队开源了WeMM-Embedding。
盼了三个月,今天 Seed-2.1-pro 终于迭代了 图片
43页财报一句话变带图表网页。
在过去的几年里,LLM RL 系统的工作负载发生了巨大的变化。早期的 RLHF 围绕同步训练展开:模型按固定顺序进行生成、打分和训练,每个阶段之间有着明确的同步边界。如今,系统还需要处理异步生成、持续训练、多轮 Agent 以及与外部环境的交互 —— 那些在同步执行中原本隐含的状态、版本和故障边界,现在都必须显式地进行管理。
近期,由斯坦福大学计算机科学博士符梓鹏(Zipeng Fu)联合创立的新团队Reward AI,正式发布通用机器人策略OM-1(Omnibody Model 1),并公布了完整的Omnibody技术栈。
10B参数以内,空间具身能力同档第一的通用多模态大模型来了!
最近几个月,AI 视频赛道开始热起来了: Seedance2.0 发布后,AI 视频进入可用阶段,MiniMax H3 发布后,以 1/4 的价格,把 Seedance 2.0 的成本打了下去,AI 视频成本进入平价时代。
Seedance 2.5 让我这个半吊子的AI视频创作者都能上瘾玩上一个多月,就不用再多余说表现有多强了吧。
具身智能最近又多了一张榜单,而排在第一的,还是一个熟悉的名字:原力灵机 DM0.5。
当大模型已经能够快速生成文案、图片和视频,一个更进一步的问题是:Agent 能否从执行过的任务中积累经验,并在持续交互中改进后续行为?
一个 Agent 第一次没把任务做对。
AI 视频,正在变成一个可以边播、边演、边改的实时系统。
想象一下这个场景:一场多人线上会议,有人说话时画面自动聚焦到发言者;一段综艺素材,后期系统能自动识别谁在讲话并生成字幕;一段监控录像,系统能在人群中持续追踪正在说话的那个人。
零样本学习的目标,是让模型识别训练时从未出现过的类别。
随着 Genie 3 的发布,可交互世界模型真正走到台前:用户不再只是观看生成视频,而是可以输入动作实时改变一个持续演化的世界。世界模型开始从「生成一段视频」走向「模拟一个可交互世界」,但能走进去,不等于经得起探索。模型能否持续响应控制、维持视觉与空间一致、遵守物理规律并记住来路,仍缺少系统评测。
北航、南方科技大学、复旦大学、北京理工大学、爱丁堡大学等 8 家机构的 19 位研究者联合完成 Theory of Agent 综述,讨论模型内部与外部 harness 应如何分配能力,并据此梳理 LLM Agent 的学习、对齐、演化与评测。
“智能并不局限于大脑内部。当我们使用纸笔或地图来梳理复杂问题时,这些外部工具就成为了我们‘延展的心智’。”
把 On-Policy Distillation(在线策略蒸馏,OPD)的训练集从 17000 道题删到 1 道,会发生什么?
过去两周里,「循环深度」这个词变成了 AI 安全讨论的焦点。
成立才一个多月,估值就要冲到 500 亿美元。
刚刚,生数上线了最新的 实时视频模型 S2,输出提高到 720p,保持 25—42 FPS,包含下面两款:
大模型过去几年的能力跃迁,几乎都围绕一个词:Scaling。
Token词元替代了Byte字节,但不意味着大模型都得是Token。