AI自己出题自己练!两个月狂涨11%,编码自测反超Opus 4.8
AI自己出题自己练!两个月狂涨11%,编码自测反超Opus 4.8Ornith-1.5采用模型自出题、自搭脚手架、自跑轨迹的三段式强化学习闭环,在Terminal-Bench 2.1自测中以86.1分超过其自测的Claude Opus 4.8(85.0分),较两个月前的1.0版本提升约11%。
搜索
Ornith-1.5采用模型自出题、自搭脚手架、自跑轨迹的三段式强化学习闭环,在Terminal-Bench 2.1自测中以86.1分超过其自测的Claude Opus 4.8(85.0分),较两个月前的1.0版本提升约11%。
在此背景下,新加坡国立大学、普林斯顿大学与斯坦福、牛津等研究团队合作提出了 Recuris(Recursive Experiential–Working Memory Evolution),作为首个将递归自我改进应用在记忆控制层内的智能体架构,Recuris 通过三项核心技术突破,无需训练即成功实现了从 3B 小模型到 Claude Opus 5 的全面提升。
那这次发布的 Hy4 Preview 到底有什么进步,APPSO 这就给你实测看看。姚顺雨此前反复提到一个思路,比起把模型训练成更会刷榜的「做题家」,混元更关心它到了真实场景里到底好不好用。
随着开源模型能力不断提升,它们已经能够以极低的成本生成多个高质量候选方案,并进一步利用模型自身对这些结果进行验证、打分和筛选。斯坦福团队最新实验发现,使用 DeepSeek V4 Flash + LLM-as-a-Verifier 进行「自验证」,可以在 Terminal-Bench 2.1 上超越 Claude Fable 5,同时整体成本低约 11 倍。
在 2026 世界人形机器人运动会 - 工业场景赛 -「装配上料岗」赛项中,一台机器人需要连续完成搬运上架、拣选上料、物料装配三项任务:从搬运 10kg 物料箱,到七类零件拣选,再到发动机 18 个气门的亚毫米级装配。
不建图、不记忆、零训练:coding-agent 被直接扔进屋里,导航成绩反超工业级专用模型。
过去两年,大模型几乎重写了人机协作的默认想象:写代码、查资料、做分析,似乎都能 “一问即答”。但仔细看会发现,当下很多能力并不是模型自己长出来的,而是人为地在外面包了一层又一层框架。
在动画和美术生产中,线稿上色是一个看似基础、却极其依赖细节控制的环节。创作者往往不是简单地把线稿涂上颜色,还需要理解角色身份、遵守局部色块约束、参考前后帧风格,并在连续片段中保持服装、发色、妆容和背景的一致性。
几个小时前,Barret Zoph 在 𝕏 上发了一条推文,他说自己将加入谷歌 DeepMind,而他的 AI 生涯正是从谷歌 Brain 的 Residency 项目起步的,这次算是重返旧地;他将专注于强化学习(RL)与后训练(Post-Training)方向,更多消息稍后公布;他还补了一句,谷歌拥有在 AI 领域持续成功所需要的全部要素,他很高兴能成为这个使命的一部分。
8 月 22 日,Lady Gaga(本名 Stefani Germanotta)在社交平台上首次公开了自己参与创办的生物技术公司 Outer Biosciences,以及公司的核心平台 Yuna。这家公司试图把机器学习、自动化实验与离体人体皮肤结合起来,希望从海量化合物中寻找新的抗衰老、抗炎和皮肤修复成分。