AI资讯新闻榜单内容搜索-后训练

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
搜索: 后训练
硅谷今日最热具身模型!不用后训练,看一遍就学会

硅谷今日最热具身模型!不用后训练,看一遍就学会

硅谷今日最热具身模型!不用后训练,看一遍就学会

刚刚,北美具身初创Skild AI又发布了全新机器人基础模型S1,直接把机器人上下文学习的任务长度拉到了10分钟往上。这次的S1主打上下文学习(in-context learning,ICL):无需在后训练阶段专门学习新的操作数据,只需看一段人类示范视频,就能“照猫画虎”,直接完成一整套从未见过的复杂操作流程。

来自主题: AI资讯
9561 点击    2026-08-27 10:14
字节Seed架构迎来重大调整

字节Seed架构迎来重大调整

字节Seed架构迎来重大调整

近期,字节跳动大模型核心部门Seed完成新一轮组织调整,调整核心集中在Seed Foundation Model(Seed基础模型)板块,新设四个一级部门,重构了预训练数据、强化学习与后训练的组织链路。

来自主题: AI资讯
9290 点击    2026-08-21 09:08
独家|腾讯混元徐灿转岗微信WeLM,微信AI进入加速阶段

独家|腾讯混元徐灿转岗微信WeLM,微信AI进入加速阶段

独家|腾讯混元徐灿转岗微信WeLM,微信AI进入加速阶段

《智能涌现》从相关人士处获悉,混元资深研究员徐灿在近期加入腾讯WeLM团队,从事大模型研发相关工作。多名知情人士透露,在姚顺雨接手腾讯大语言模型研发前,徐灿在混元LLM体系中担任后训练一个方向上的负责人。值得一提的是,这次转岗发生在微信持续强化自研大模型和Agent能力的阶段。

来自主题: AI资讯
8515 点击    2026-08-14 22:44
无本体数据直达真机,深朴智能拔掉机器人后训练的「真机数据锚点」

无本体数据直达真机,深朴智能拔掉机器人后训练的「真机数据锚点」

无本体数据直达真机,深朴智能拔掉机器人后训练的「真机数据锚点」

当下,一个逐渐清晰的共识是,具身智能的叙事正由「会不会做一个动作」,转向「能不能在真实世界里稳定完成复杂任务」。尤其是在刚刚过去的 WAIC2026 现场,这一点尤为明显,机器人不再满足于表演式的单动作演示,而是被期待走进产线、仓储和酒店客房,真正「做事」。

来自主题: AI技术研报
8680 点击    2026-08-05 11:27
ECCV 2026|Google等推出VGGRPO:用4D隐空间奖励实现世界一致的视频生成

ECCV 2026|Google等推出VGGRPO:用4D隐空间奖励实现世界一致的视频生成

ECCV 2026|Google等推出VGGRPO:用4D隐空间奖励实现世界一致的视频生成

最近,来自 Google、哥本哈根大学、牛津大学等机构的研究者提出了 VGGRPO(Visual Geometry GRPO,收录于 ECCV 2026)。这项工作聚焦于一个核心问题:如何在不牺牲预训练模型泛化能力的前提下,高效地提升视频生成的几何一致性,并使其适用于动态场景。其核心思路是,在隐空间(latent space)中利用 4D 几何奖励,进行几何感知的视频后训练。

来自主题: AI技术研报
10282 点击    2026-07-18 10:09
小米发布Xiaomi-Robotics-1具身基座模型:100000h真实数据,首次系统验证机器人Scaling Law

小米发布Xiaomi-Robotics-1具身基座模型:100000h真实数据,首次系统验证机器人Scaling Law

小米发布Xiaomi-Robotics-1具身基座模型:100000h真实数据,首次系统验证机器人Scaling Law

今天,小米刚刚扔出一颗“深水炸弹”——Xiaomi-Robotics-1具身基座模型,试图改变这一局面。Xiaomi-Robotics-1基于10万小时真实世界操作轨迹进行预训练,再用约1.1万小时跨本体数据完成后训练。据悉,这是国内首次在机器人策略模型中,对Scaling Law进行较为完整的系统验证。

来自主题: AI资讯
8968 点击    2026-07-16 16:24
大模型RL训练为何会「越训越窄」?ACL Outstanding Paper从token-level熵变揭示RLVR训练机制

大模型RL训练为何会「越训越窄」?ACL Outstanding Paper从token-level熵变揭示RLVR训练机制

大模型RL训练为何会「越训越窄」?ACL Outstanding Paper从token-level熵变揭示RLVR训练机制

基于可验证奖励的强化学习(Reinforcement Learning with Verifiable Rewards,RLVR)正在成为大模型后训练的关键技术。数学题能判对错,代码能跑测试,可验证奖励让大模型可以通过强化学习持续提升推理能力。

来自主题: AI技术研报
10618 点击    2026-07-16 10:10
北航、北大和美团联合提出:策略提升强化学习!

北航、北大和美团联合提出:策略提升强化学习!

北航、北大和美团联合提出:策略提升强化学习!

来自北航、北大、美团的研究团队提出了Policy Improvement Reinforcement Learning, PIRL,以及对应的落地算法 PIPO。这项工作关注的是大模型 RL 后训练中一个非常基础、但长期被默认跳过的问题:一次更新在当前数据上看起来优化了学习信号,是否就真的说明模型策略变强了?

来自主题: AI技术研报
8405 点击    2026-07-12 10:44
ICML 2026|小模型也能「指挥」大模型RL后训练:清华&腾讯提出GPS,最高减少69% Rollout成本

ICML 2026|小模型也能「指挥」大模型RL后训练:清华&腾讯提出GPS,最高减少69% Rollout成本

ICML 2026|小模型也能「指挥」大模型RL后训练:清华&腾讯提出GPS,最高减少69% Rollout成本

来自清华大学与腾讯的研究者提出了 Generalizable Predictive Prompt Selection(GPS)。GPS 的做法很直接:先训练一个小型、可泛化的 Prompt Predictive Model(PPM),让它预测不同 prompt 在当前模型下的难度;再根据难度和 batch 多样性选择训练样本,从而减少无效 rollout。

来自主题: AI技术研报
8765 点击    2026-07-11 11:16