Loss收敛不代表学会:腾讯混元ACL 2026拆解SFT训练中15.3%的“假学会”样本
Loss收敛不代表学会:腾讯混元ACL 2026拆解SFT训练中15.3%的“假学会”样本SFT是LLM从“通才”变成“专才”的关键步骤。业界默认做法是:准备标注数据(QA对、指令-回复对等)在基座模型上跑SFT训练。看loss曲线收敛了→认为训练完成。但问题在于:loss是全局平均,掩盖了样本间的差异。loss收敛只代表“大部分样本学会了”——那些始终学不会的样本被淹没了。
搜索
SFT是LLM从“通才”变成“专才”的关键步骤。业界默认做法是:准备标注数据(QA对、指令-回复对等)在基座模型上跑SFT训练。看loss曲线收敛了→认为训练完成。但问题在于:loss是全局平均,掩盖了样本间的差异。loss收敛只代表“大部分样本学会了”——那些始终学不会的样本被淹没了。
经常用AI的人都知道,AI给出的答案质量,很大程度上取决于你提问的方式。这一点,几乎成了当下社交媒体的流量密码。打开各大平台,随处可见兜售各类Prompt的帖子,我们自己的收藏夹里也往往躺着几十套Pr
2023 年他在深圳创立听象科技,推出自有品牌昂听 ELEHEAR(下文统一简称 ELEHEAR)。前期发布 Alpha 系列产品试水助听器市场,2024 年 10 月推出旗舰产品 Beyond,凭借全栈自研的 AI 助听器+远程实时验配的新模式,用 1 年时间做到了美国亚马逊助听器类目 Top1,年销超 1500 万美元,市场份额从 1% 迅速增长至 18%。
多模型Agent系统显然是未来的趋势。cursor 的一篇很不错的文章。他们的最新研究表明,将前沿模型作为规划者和协调者,与一个更廉价的“主力”模型搭配,可以大幅降低项目中总token的成本,从而实现 15 倍的成本改进。
停停停!Kimi K3的最佳打开方式可能不在Coding——用它做前端设计,才是真·Interesting。在Design Arena最新公布的单次生成前端榜单中,Kimi K3以1414分位列第一,力压Fable 5和GPT-5.6 Sol。
近日,Meta 首席 AI 官、被称为公司“最高薪员工”的 Alexandr Wang,因一句简单却极具挑衅意味的话引起热议:“gemini who?(Gemini,谁啊?)”这场口水战的背后,其实是一场 AI 巨头之间的公开较量——Meta 最新模型 Muse Spark 1.1 在一份模型排行榜中超过了谷歌刚发布的 Gemini 3.6 Flash
刚刚,英伟达创始人黄仁勋发出了自己人生第一条推特:在老黄的第一篇帖子中,他分享了一封英伟达签署的信函《开放权重与美国 AI 领导力》,阐述为什么开源模型很重要。他表示,人工智能将改变每个行业,赋能每个公司,并由每个国家构建。开源模型加强安全性和网络安全,加速创新和传播,并实现主权。
7 月 24 日,Vivix 正式发布两款激活参数约 30B 的模型 Vivix-A1(开放世界演员)和 Vivix-W1(开放世界剧情)。这次发布试图回答的问题不是"生成能不能更快",而是更前一步的:模型在持续生成音视频的同时,能不能随时接住用户的新输入,并即时改变正在生成的内容?
3D打印无疑是全球增长最受关注的赛道之一,但结构化、可编辑的物理3D数据却极度稀缺。就在这个行业真空里,一家年轻公司浮出水面——AI生成矢量3D模型的比特无限(BitInf)。
根据IT桔子数据,截至2026年7月17日, 32家“商汤系”公司在上半年共完成28笔融资,累计融资额超过470亿元人民币,在中国AI融资市场取得了耀眼的成绩。其中,既有商汤科技自身通过“1+X”战略拆分出的子公司——曦望Sunrise、大晓机器人、商汤医疗等;也有大批从商汤离职创业的前高管所创立的公司