攀爬AGI的南北坡:语言模型之外,生数从世界模型出发
攀爬AGI的南北坡:语言模型之外,生数从世界模型出发中国AGI两条上山路径:一条让机器理解、运用语言,另一条让机器认知、推演并改造世界,二者终会交汇。
搜索
中国AGI两条上山路径:一条让机器理解、运用语言,另一条让机器认知、推演并改造世界,二者终会交汇。
进入到 2026 年,可交互世界生成面对一道更难的考题:AI 生成的世界能否经得起用户反复探索?一扇门画得逼真,只是起点。往前走,它要自然靠近;穿过走廊再回头,它还应该留在原来的位置。用户每一次移动、转身和折返,都在检验模型是否有能力记住已经生成的世界。
「麻烦你,帮我看一下。」
9月初,OpenAI下一代模型Astra的架构细节被曝光,核心关键词只有一个:循环。
具身智能讨论的核心问题正在改变:从谁有更多数据能做出更强基础模型,转向谁能把机器人真正部署到现场,并让它持续做成任务。
一句话概括:文本世界模型都在比 "生成文本像不像真实环境",但我们发现文本更接近真实环境的预测反而可能让智能体错得更离谱。把训练目标从 "状态一致" 换成 "行为一致" 后,16 组实验配置下世界模型的轨迹级一致性几乎全面提升,弱智能体离线评测的假阳性率从 42.5% 降到 9.5%。
字节跳动创始人张一鸣亲自督战基于Seedance打造的空间视频生成AI模型,预计最快10月面世,该模型可响应PICO头显用户指令实时生成虚拟世界,有望盘活PICO并推动字节进入世界模型赛道。
近年来,视频生成模型在清晰度、时序一致性和可控性上快速进步。给定文本、图像、相机轨迹或玩家动作,模型已经能够合成连贯的后续画面,也让「可交互视频世界」逐渐从概念走向可观看、可操作的原型。
图形学宗师童欣正式加盟胡渊鸣创办的AI 3D公司Meshy出任首席科学家,将负责制定长期科研战略,与胡渊鸣共同推进多模态世界模型与实时交互系统突破,朝着"AI for Fun"的愿景迈进。
智象未来(HiDream.ai)正式发布具身世界模型HiDream-O1-Embodied,该模型在具身智能评测平台RoboColiseum扰动适应子榜单中以0.692分登顶榜首,标志着智象原生全模态世界模型矩阵的进一步完善。