实测混元 Hy4 Preview:腾讯终于踩下油门,能杀入国模第一梯队吗?
实测混元 Hy4 Preview:腾讯终于踩下油门,能杀入国模第一梯队吗?那这次发布的 Hy4 Preview 到底有什么进步,APPSO 这就给你实测看看。姚顺雨此前反复提到一个思路,比起把模型训练成更会刷榜的「做题家」,混元更关心它到了真实场景里到底好不好用。
搜索
那这次发布的 Hy4 Preview 到底有什么进步,APPSO 这就给你实测看看。姚顺雨此前反复提到一个思路,比起把模型训练成更会刷榜的「做题家」,混元更关心它到了真实场景里到底好不好用。
随着开源模型能力不断提升,它们已经能够以极低的成本生成多个高质量候选方案,并进一步利用模型自身对这些结果进行验证、打分和筛选。斯坦福团队最新实验发现,使用 DeepSeek V4 Flash + LLM-as-a-Verifier 进行「自验证」,可以在 Terminal-Bench 2.1 上超越 Claude Fable 5,同时整体成本低约 11 倍。
在 2026 世界人形机器人运动会 - 工业场景赛 -「装配上料岗」赛项中,一台机器人需要连续完成搬运上架、拣选上料、物料装配三项任务:从搬运 10kg 物料箱,到七类零件拣选,再到发动机 18 个气门的亚毫米级装配。
不建图、不记忆、零训练:coding-agent 被直接扔进屋里,导航成绩反超工业级专用模型。
过去两年,大模型几乎重写了人机协作的默认想象:写代码、查资料、做分析,似乎都能 “一问即答”。但仔细看会发现,当下很多能力并不是模型自己长出来的,而是人为地在外面包了一层又一层框架。
在动画和美术生产中,线稿上色是一个看似基础、却极其依赖细节控制的环节。创作者往往不是简单地把线稿涂上颜色,还需要理解角色身份、遵守局部色块约束、参考前后帧风格,并在连续片段中保持服装、发色、妆容和背景的一致性。
几个小时前,Barret Zoph 在 𝕏 上发了一条推文,他说自己将加入谷歌 DeepMind,而他的 AI 生涯正是从谷歌 Brain 的 Residency 项目起步的,这次算是重返旧地;他将专注于强化学习(RL)与后训练(Post-Training)方向,更多消息稍后公布;他还补了一句,谷歌拥有在 AI 领域持续成功所需要的全部要素,他很高兴能成为这个使命的一部分。
8 月 22 日,Lady Gaga(本名 Stefani Germanotta)在社交平台上首次公开了自己参与创办的生物技术公司 Outer Biosciences,以及公司的核心平台 Yuna。这家公司试图把机器学习、自动化实验与离体人体皮肤结合起来,希望从海量化合物中寻找新的抗衰老、抗炎和皮肤修复成分。
刚刚,北美具身初创Skild AI又发布了全新机器人基础模型S1,直接把机器人上下文学习的任务长度拉到了10分钟往上。这次的S1主打上下文学习(in-context learning,ICL):无需在后训练阶段专门学习新的操作数据,只需看一段人类示范视频,就能“照猫画虎”,直接完成一整套从未见过的复杂操作流程。
借助高效的相似方案召回,同程旅行不仅能按照用户的人数、时间、预算、座位约束条件找到最佳的直达线路;也能在直达票售罄的情况下,帮助用户快速找到如:车内换座直达、短换乘时间等替代方案。