智谱唐杰:大模型只看参数的时代,结束了

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
智谱唐杰:大模型只看参数的时代,结束了
8449点击    2026-08-20 10:54

Scaling Law还在,但今天的大模型,已经不能只靠“参数量”来理解Scaling了。


这是智谱创始人、清华大学教授唐杰对于Scaling Law的最新判断。


他在X上发表的一则有关Thoughts About Scaling Law的帖子,开头便把大模型发布会上最常见的那个问题拆了——


Scaling,但Scaling的不只是参数。


智谱唐杰:大模型只看参数的时代,结束了


在唐杰看来,单独报出参数量,已经很难说明一个模型究竟处在什么规模水平。


至少还要一起看三件事——


用了多少数据、准备把算力花在哪里,以及模型最终由谁、在什么条件下运行。


过去几年,大模型的Scaling路线已经发生过几次集体转向。


从一味扩大参数,到增加训练数据,再到把推理成本和后训练纳入计算,每次转弯都在改写同一个答案:


所谓的“最优Scaling”,其实会随着任务、架构和使用方式不断变化。


唐杰复盘Scaling Law:参数从来无法单独决定能力


唐杰先翻出了大模型Scaling史上一段相当经典的“集体转弯”。


2020年,Kaplan等研究者通过不同规模的语言模型拟合Scaling Law,得出一个影响深远的结论——


计算预算增加时,模型参数应该比训练数据增长得更快。


唐杰在帖文中,将两者的增长关系概括为约2.7∶1。


这套结论很快为大模型竞赛定下方向,GPT-3、Gopher和MT-NLG相继登场,参数量从1750亿一路涨到5300亿,万亿参数也逐渐成为前沿模型的代表性目标。


智谱唐杰:大模型只看参数的时代,结束了


模型越做越大,参数表越来越吓人。


然而两年后,DeepMind重新做了一遍实验,问题随即暴露出来。


团队训练了超过400个模型,覆盖7000万到160亿参数、50亿到5000亿训练Token。


结果显示,当时的大模型普遍塞入了太多参数,吃进去的数据却远远不够。


找到问题后,DeepMind又训练了一个更小的模型:Chinchilla。


它只有700亿参数,比2800亿参数的Gopher小了四倍;训练数据达到1.4万亿Token,又多了四倍。


同样的训练计算量下,小一圈、吃得更饱的Chinchilla全面超过Gopher,还压过GPT-3、Jurassic-1和MT-NLG。


由此诞生的Chinchilla Scaling Law,将计算最优配比推向约20个Token对应一个参数,随着计算预算增长,参数与训练数据也应该近似同步扩大。


这次转向,也让唐杰重新评价此前的参数竞赛——


在他看来,早期Scaling Law中的拟合误差,会随着计算规模不断累积。模型越大,参数与数据之间的资源错配也可能越严重。


回头再看,那轮万亿参数竞赛,成了全行业共同走过、随后又折返的一段岔路。


智谱唐杰:大模型只看参数的时代,结束了


但在唐杰的复盘里,Chinchilla也没有给出一劳永逸的答案。


因为Chinchilla解决的是训练阶段的资源分配:一个模型只训练一次,在固定计算预算下,参数和数据该怎么搭配。


可模型训练完成后,还要被一次次调用,今天的头部模型每天可能处理数十亿次请求,模型越大,每次运行需要的计算量和部署成本也越高。


推理成本由此进入Scaling的账本,最优方案也跟着再次移动。


此外相关研究也发现,如果一款模型预计要处理约10亿次请求,更小的模型配合更长时间训练,可能拥有更低的全生命周期成本,研究者把训练强度一路提高到每参数1万个Token,模型质量仍在继续改善。


智谱唐杰:大模型只看参数的时代,结束了


唐杰在帖文中举了两个已经“超额训练”的例子——


Llama 2 7B每个参数约对应290个训练Token,Gemma 2 9B更达到约889个,远远超过Chinchilla时期的20。


从扩大参数,到补足数据,再到计算整个生命周期的推理成本,Scaling的重点一路移动。背后的问题却始终没变:


那就是有限的计算资源,究竟该花在哪里。


总参数管容量,激活量影响推理


到了MoE模型,这道资源分配题又多了一层。


唐杰将参数拆成两个维度——


总参数量更像模型的仓库,决定它能装下多少知识、事实和长尾信息。


激活参数量与有效深度,则更接近模型一次能够调动多少能力,把推理链走多远。


这两种能力,在漏洞发现中很容易区分。


模型记住更多CVE,意味着它见过更多案例,可真正遇到一个新漏洞,它还要从异常代码追到触发条件,再设计验证方法和利用路径,连续走完二十步推理,途中不能丢掉线索。


智谱唐杰:大模型只看参数的时代,结束了


因此在唐杰看来,发现漏洞依赖长链推理能力,很难用总参数量直接衡量。


这套判断,也给GLM-5.3的训练方向提供了解释。


智谱保留了GLM-5.2的基座和架构,总参数量与激活参数量同样保持不变,过去一个月,团队把新增计算集中投入长程任务环境与强化学习。


参数表原地没动,提升来自后训练。


智谱唐杰:大模型只看参数的时代,结束了


智谱官方发布页显示,GLM-5.3在Terminal-Bench 3.0上从4.6升至28.3,DeepSWE从46.2涨到66.9,Agents’ Last Exam也从23.8升至28.5。


这些成绩目前主要来自智谱官方测试,外部复现还要等待模型权重开放,但对唐杰来说,这次实验已经验证了一个阶段性判断——


Scaling有很多旋钮。


GLM-5.3这次拧动后训练,因为这里当时拥有最大的剩余空间。


参数规模、预训练数据和单次前向计算量依然留在牌桌上,智谱之后也可能重新转向中训练、预训练,继续扩大其他方向。


多个旋钮无需同时转动。上一次最值得投入的方向,到了下一轮,可能已经让位给新的瓶颈。


当前大模型的竞赛单位,正在从谁的知识库更大,转向谁能让模型在真实环境里把复杂任务做完。


如果模型只是回答问题,参数规模依然很好讲。


但如果它要连续工作几小时、几天,甚至像一个数字员工那样接手完整项目,那么决定胜负的就不只是它记住了多少,而是它能不能一直不掉线、不跑偏,并且对结果负责。


万亿参数没有消失。


只是从现在开始,它可能不再是唯一值得被写进标题的那个数字。


参考链接:

[1]https://x.com/jietang/status/2089941544581403107


文章来自于"量子位",作者 "梦瑶"。

关键词: AI新闻 , 智谱 , 唐杰 , 人工智能
AI转型,免费服务,就找AITNT
AITNT资源拓展
根据文章内容,系统为您匹配了更有价值的资源信息。内容由AI生成,仅供参考
1
智能体

【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。

项目地址:https://github.com/Significant-Gravitas/AutoGPT


【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。

项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md

2
知识库

【开源免费】FASTGPT是基于LLM的知识库开源项目,提供开箱即用的数据处理、模型调用等能力。整体功能和“Dify”“RAGFlow”项目类似。很多接入微信,飞书的AI项目都基于该项目二次开发。

项目地址:https://github.com/labring/FastGPT