北航、北大和美团联合提出:策略提升强化学习!
北航、北大和美团联合提出:策略提升强化学习!来自北航、北大、美团的研究团队提出了Policy Improvement Reinforcement Learning, PIRL,以及对应的落地算法 PIPO。这项工作关注的是大模型 RL 后训练中一个非常基础、但长期被默认跳过的问题:一次更新在当前数据上看起来优化了学习信号,是否就真的说明模型策略变强了?
搜索
来自北航、北大、美团的研究团队提出了Policy Improvement Reinforcement Learning, PIRL,以及对应的落地算法 PIPO。这项工作关注的是大模型 RL 后训练中一个非常基础、但长期被默认跳过的问题:一次更新在当前数据上看起来优化了学习信号,是否就真的说明模型策略变强了?
来自清华大学与腾讯的研究者提出了 Generalizable Predictive Prompt Selection(GPS)。GPS 的做法很直接:先训练一个小型、可泛化的 Prompt Predictive Model(PPM),让它预测不同 prompt 在当前模型下的难度;再根据难度和 batch 多样性选择训练样本,从而减少无效 rollout。
有没有一种更为合适的 OPSD 范式?近期,清华大学和马普所等机构的研究者们联合推出的 d-OPSD,给这一问题提供了完美的答案。这是第一个针对扩散大语言模型的 OPSD 范式,无需参考解,无需额外的教师模型,只需要 RL 十分之一的训练步数,便可以达到或超出 RL 的后训练效果。
最新世界模型 LingBot-World 2.0 正在试图实现的事情。「一个世界只需要几秒钟就能造出来」不再仅限于预制的世界,而是让每一次生成,都是一次全新的创造。这是一个秒级生成、支持实时交互的开源世界模型。
7月9日,投中网获悉,物理AI公司深度智控(DeepCtrls)(以下简称“深度智控”)已完成战略轮与B轮融资,合计融资金额数亿元,本轮资金将用于核心产品研发、商业化拓展及国际化布局。深度智控成立于2018年,定位为物理AI能源基础设施服务商。
智源研究院悟界·RoboBrain Orca Team发布的技术报告Orca: The World is in Your Mind,想探索的正是这个问题。也有评论认为,Orca更接近早期通用世界模型的形态,即先学习世界如何变化,再将这种世界表征读出到理解、预测和行动任务中。
专注于4D世界模型研发和产业化的魔芯科技联合浙江大学潘云鹤院士团队发布MoWorld——全球首个Flash World Model,也是首个全栈基于国产NPU构建的实时交互世界模型。
以 LeWorldModel(LeWM)为例,它在规划时有一个重要瓶颈:每评估一条候选动作序列,模型都要一步步自回归 rollout。也就是说,LeWM 先预测下一步 latent,再把预测出的 latent 输入 dynamics model,继续预测下一步:
从李飞飞World Labs的50亿估值,到LeCun出走创立AMI Labs的十亿种子轮,再到谷歌Genie 3让文本生成的世界第一次具备实时可交互、可导航的形态,世界模型正在成为AI下一阶段的核心战场。
做大模型RL微调,你是不是也踩过这些坑?