你的员工不肯把自己"蒸馏"给AI,这才是AI转型最大的卡点
你的员工不肯把自己"蒸馏"给AI,这才是AI转型最大的卡点白双的公司里没有前端工程师。
搜索
白双的公司里没有前端工程师。
在模型层之外,2026 年上半年在硅谷增长最快的赛道之一是数据:Mercor 的 run rate 从去年下半年的 5 亿美元涨到今年年中的 20 亿美元;Handshake 转型 human data 后,run rate 在年初三个月内从 5.5 亿美元冲到 10 亿美元;RL 环境公司 Fleet 则在半年内从百万美元级别做到 6000 万美元 run rate,
据 The Information报道,创始人张一鸣在上个月的一场内部会议上向员工明确表达了这一立场,也让外界难得一窥他对字节跳动AI发展路线的思考。外媒披露,在Seed团队内部,关于公司是否应该转向蒸馏技术的争论由来已久。今年,国内竞争对手开源模型的快速发展给字节跳动带来了更大的压力。员工们称,每当有一个强大的中国开源新模型发布,字节跳动内部关于蒸馏的争论就会升温。
在折腾了一段时间、跟一些中文系的朋友讨教,又把我们内部的写作skill蒸馏出来了通用的规则,最后甚至手写了一部分的skill文档之后。我觉得,我终于可以,来给大家汇报一下这段时间的成果了。活人感写作.skill,英文名叫human Writing.skill
过去的 Diffusion RL 多聚焦于奖励设计与优化算法,训练时的采样成本被忽视。DMSampler 指出:在在线 RL 中,限制规模化的不只是奖励信号或优化器,很多时候是 rollout 本身太贵。
采访中,吴英成把自己正在做的事压缩成一句话:“上一代 AI 蒸馏的是互联网,下一代 AI for Science 应该‘蒸馏地球’。”
现在,你可以通过录屏 + 语音讲解的方式,彻底把自己蒸馏成 Skill 了。7 月 21 日,Anthropic 在 Claude 桌面端 Cowork 的 + 菜单里加了一项「Record a Skill」:录屏,一边操作一边用语音讲解,录完后 Claude 自动把演示转化成一个可复用的 Skill。
大家好,我是袋鼠帝 几天前我尝试做了一个相对粗糙的视频,是关于我开源的仓颉Skill的 没想到居然爆火了!(全网将近50万播放)。
有没有一种更为合适的 OPSD 范式?近期,清华大学和马普所等机构的研究者们联合推出的 d-OPSD,给这一问题提供了完美的答案。这是第一个针对扩散大语言模型的 OPSD 范式,无需参考解,无需额外的教师模型,只需要 RL 十分之一的训练步数,便可以达到或超出 RL 的后训练效果。
最近,来自新加坡国立大学、香港中文大学 MMLab、北京大学和京东探索研究院的研究团队提出了一种全新的在线策略蒸馏方法: DOPD (Dual On-policy Distillation) ,通过优势感知的双重蒸馏范式,成功破解了这一难题。