苹果新作:内化视觉思考,推理提速 5 倍
苹果新作:内化视觉思考,推理提速 5 倍苹果研究团队提出 Internalized Visual Thinking(IVT)后训练框架,通过在训练阶段联合学习文本答案与未来帧隐空间表征、在推理阶段完全移除未来视觉预测过程,使模型在主动视频推理任务上相比 Visual CoT 获得超过 5 倍的推理加速,且在六项评测设置中均优于 Answer-Only SFT。
搜索
苹果研究团队提出 Internalized Visual Thinking(IVT)后训练框架,通过在训练阶段联合学习文本答案与未来帧隐空间表征、在推理阶段完全移除未来视觉预测过程,使模型在主动视频推理任务上相比 Visual CoT 获得超过 5 倍的推理加速,且在六项评测设置中均优于 Answer-Only SFT。
微软与UIUC合作研究StudentSim框架,基于真实学生数据训练个性化学生模拟器,具备behavioral fidelity和guidance responsiveness两项能力,在国际象棋等三个领域验证其优于现有基线,并可作为AI教师强化学习的高通量奖励信号。
OpenAI正式发布GPT-6 Astra,宣称其为"全球最智能且最对齐的模型",在电脑操作(OSWorld完成率72.6%)、ARC-AGI-3(99.9分)、审美判断力、主动性及网络安全(首个达Critical等级)等方面全面升级,Greg Brockman在媒体闭门会上宣布"欢迎来到AGI时代"。
前DeepMind AI Scientist团队创立的Inherent获5000万美元种子融资,其基于Qwen3.6-27B后训练的科研判断系统Faraday在AI for Science预留测试集上以0.791的平均得分超越Claude Opus 4.8与GPT-5.5 Codex。
Meta推出实时音频感知模型Muse Voice Transcribe,支持超20位说话人分割与超1小时长音频转写,可无缝切换中英文夹杂表达,在Artificial Analysis流式语音转文本基准测试中排名第一。
EvoMap团队推出自进化智能体EvoX,采用无中心调度的蜂群模式让大量Agent平级协作、自主组队,在563道逻辑、数学、物理题上将Claude Haiku 4.5的正确率从单Agent的26.29%提升至70%以上,并开源AutoResearch项目构建Agent经验基础设施。
影眸Hyper3D发布世界生成模型WorldGen,用户上传一张场景图片即可在两三分钟内生成由多个独立可交互物体组成的3D场景,物体具备质量、摩擦系数等物理属性,可直接接入Blender、Unity、Unreal Engine等主流工具及机器人仿真环境,标志着3D生成进入场景级时代。
AlphaEvolve再次刷新记录!
模型不更新,能力却持续增长。
前两天刷 X 的时候,一条 Twitch 直播的录屏给看傻眼了: FAL 工程师 Rehan Sheikh 将 MiniMax H3 Max 接入 Twitch 直播流,搭建了一个由模型持续生成内容的频道,并把它称为「跨维度电视」。