T-RO综述重构Foundation Model时代机器人操作知识版图
T-RO综述重构Foundation Model时代机器人操作知识版图过去几年,机器人操作领域几乎被一批新概念重新 “刷屏”。 LLM Planner、VLA、Diffusion Policy、Flow Matching、Latent Action、World Mode
搜索
过去几年,机器人操作领域几乎被一批新概念重新 “刷屏”。 LLM Planner、VLA、Diffusion Policy、Flow Matching、Latent Action、World Mode
沙特人工智能公司HUMAIN基于中国MiniMax的开源旗舰模型MiniMax M3推出阿拉伯语大模型HUMAIN M3,使用超过1万亿Token阿拉伯语数据进行后训练,在七项阿拉伯语基准测试中等权平均分达89.37%,标志着中国开源模型正成为全球AI生态的底层技术基础。
最近,英伟达发了篇官方的大模型推理指南,结果翻着翻着,硬是让人看成了一本华人团队的论文合集。
OpenAI正式发布旗舰模型GPT-6 Astra,宣称其为全球最智能模型并在多项基准测试中刷新SOTA,其计算机使用能力达人类水平,动用超10万块GPU训练,且成为首款在训练监督中由先前AI模型发挥重要作用及首个达到网络安全Critical级别的模型,OpenAI总裁Greg Brockman宣布人类正式进入AGI时代。
训练一个大模型之前,语料需要经过解析、清洗、去重、质量评分、Token化和样本组装。
苹果研究团队提出 Internalized Visual Thinking(IVT)后训练框架,通过在训练阶段联合学习文本答案与未来帧隐空间表征、在推理阶段完全移除未来视觉预测过程,使模型在主动视频推理任务上相比 Visual CoT 获得超过 5 倍的推理加速,且在六项评测设置中均优于 Answer-Only SFT。
微软与UIUC合作研究StudentSim框架,基于真实学生数据训练个性化学生模拟器,具备behavioral fidelity和guidance responsiveness两项能力,在国际象棋等三个领域验证其优于现有基线,并可作为AI教师强化学习的高通量奖励信号。
让GPU学会给三维世界“排队”。
戴森发布售价3899元的AI可视成像电动牙刷CameraJet,将电动牙刷、冲牙器、内窥镜和AI图像识别系统集成于同一手柄,通过刷头内置微距相机和基于47万张牙齿图像训练的算法自动识别牙缝并向其喷出漱口水,将于9月7日开启预售。
强化学习与可验证奖励(RLVR)已成为提升视觉语言模型(VLM)推理能力的标配手段。但一个隐蔽的问题始终存在:最终答案的奖励信号,只告诉模型「答对了没有」,却从不告诉它「答案应该从图像的哪个区域得出」。答对,可能是因为真的看懂了图,也可能只是语言先验的捷径、数据集的偏差,甚至是一次幸运的瞎猜。