清华团队再探 On-Policy Distillation:数据撑死,算法饿死
清华团队再探 On-Policy Distillation:数据撑死,算法饿死把 On-Policy Distillation(在线策略蒸馏,OPD)的训练集从 17000 道题删到 1 道,会发生什么?
搜索
把 On-Policy Distillation(在线策略蒸馏,OPD)的训练集从 17000 道题删到 1 道,会发生什么?
大模型过去几年的能力跃迁,几乎都围绕一个词:Scaling。
真实家庭任务往往从「不完整的信息」开始:机器人不知道目标在哪里,用户也未必能一次说清自己想要什么。面对「帮我从餐桌上拿点零食」这样的模糊指令,机器人不仅要主动寻找候选物体,还要在发现面包和多个甜甜圈后进一步询问用户,确认究竟该拿哪一个。
多轮智能体任务只有一个终点奖励,但在一条包含搜索、工具调用和多轮决策的轨迹里,决定成败的往往是一个不起眼的查询词、动作或对象选择。
北京中关村学院7名博士生,用一个暑假,从零训练出了一个7B大模型——ZGCM-1。
让 AI 帮忙发一封邮件,它可能把正文写得妥帖、附件整理得齐全,最后却发错了人。
说AI毁了数学,可能还是太小瞧AI了。
据雷峰网独家获悉,一位长期在英国工作的Google Gemini预训练专家(L7-L8级别)近期加入国内某互联网大厂,被视为本轮BAT高价争抢Gemini人才以来首次"找对了人";此前多家大厂虽从Gemini硅谷办公室挖角,但因Google有意将核心预训练人才留在DeepMind英国办公室,导致此前引入的部分人选并未触及预训练核心环节。
最近,越来越多应用层 AI 企业走上了一条相似的路线:用自己积累的专业知识和业务经验,训练自己的模型。
让模型自己生成训练数据、自己改写提示词、自己修复代码,这条路线被称为: 递归自我改进(Recursive Self-Improvement,RSI)。