
跑分这事儿,最近有点不太对劲。
9月8日,分析机构SemiAnalysis连甩五条推文,直接点名谷歌和Meta两家万亿巨头——
Gemini 3.8 Flash和Muse Spark 1.3是「刷榜痕迹最明显的两个模型」。

证据,非常清晰。
在测Agent干活能力的Terminal-Bench 2.1榜单上,Gemini 3.8 Flash考了89.4分,在182个模型里高居第2,把GPT-6 Astra都压在了身下。
结果换到8月29日刚上线的Terminal-Bench 4.0,同一个模型只拿到19.1分,在14个测试对象里直接掉到第12,成绩当场打了个二折。
同一时间,GPT-6 Astra从88.4掉到57.7,好歹算个六五折。

仅仅27分钟后,Meta首席AI官Alexandr Wang亲自杀到评论区,开口直接甩出六个字,这是个愚蠢的论点。
他认为GPT-5.6 Sol在2.1上是88.8,在4.0上掉到了37.3,落差更大但没人说Sol在刷榜。
同时他还强调,Meta从没说过Muse Spark 1.3能跟Astra或Fable 5.1一样强,只是它的性价比显然更高。

换张卷子,成绩直接脚踝斩
简单介绍一下,Terminal-Bench测的是Agent真实干活的能力。
方法是丢给模型一个终端和一个模糊目标,剩下的全让它自己看着办。然后,系统得自行规划路径、调工具、写脚本,报错了还得自己去改。
在已经被业界刷了大半年的2.1版本上,这俩的成绩确实好看。
Gemini 3.8 Flash拿下89.4分排在第2,Muse Spark 1.3以88.8分排在第4,紧随其后的是88.4分的GPT-6 Astra和85.02分的Claude Fable 5.1。

好家伙,一个Flash级的便宜模型,一个主打性价比的Meta新作,双双把两家顶级实验室的旗舰按在地上摩擦。
然后,4.0版本来了。
新卷子一共66道题,不仅砍掉了8道已经被「刷穿」的旧题,大修了19道,还统统加上8小时的超时限制。
防作弊机制同样上了极高强度。
主办方不仅设了35条评分细则,还加了一轮专门的「对抗性作弊试验」,故意让Agent自己去试着钻奖励机制的空子,只要钻得通的题就会被直接毙掉。
新榜一出,画风突变。

Claude Mythos 5.1(max)拿到60.9分稳住阵脚,GPT-6 Astra和Claude Fable 5.1分别以57.7分和55.8分紧随其后,再往下是52.3分的Claude Opus 5。上一代的GPT-5.6 Sol和Terra分别拿到37.3分和23.6分。
相比之下,Gemini 3.8 Flash直接暴跌到19.1分。而按SemiAnalysis给出的图表,Muse Spark 1.3的成绩是33.3分。
总结一下就是。
旧榜上,Gemini 3.8 Flash还能压着GPT-6 Astra打;新榜上,它的分连人家的三分之一都不到,甚至被上一代的GPT-5.6 Terra甩在了后面。
不用抄答案,买套「密卷」就行
吵架归吵架,SemiAnalysis第二条推的点名才是真正的行业内幕。
在他们看来,Terminal Bench 2.1的任务是完全公开的,Meta和谷歌绝对不会傻到直接拿原题去训练,但他们绝对会去买数据,专门买那些被设计得无限贴近TB 2.1题型的训练数据。最后的效果其实跟作弊没差。
而这,就是2026年刷榜的高阶玩法。

以前的「污染」套路很糙,直接把原题混进预训练语料让模型死记硬背。
这种事一查一个准,洗一遍数据成绩就得现原形。
业界在这上面栽过不少跟头,比如HumanEval近四成样本被污染,GSM8K去污染后掉13分。最狠的是SWE-bench,换套私有代码库重测,分数直接腰斩。
所以现在大厂不碰原题了,大家改买「长得像考题的模拟卷」。也就是提供给模型试错并给奖励的封闭任务系统。
目前,这已经是一门明码标价的成熟生意。
根据Epoch AI的调研,Anthropic内部讨论过每年在这上面砸10亿美元。单季合同动辄六七位数,有研究员透露均价在30万到50万美元一季。
供给侧至少有35家公司在做这门生意,绝大多数是20人以下的初创团队。老牌数据巨头也全在转型,Scale AI在被Meta入股前营收就超14亿,Surge的ARR也逼近10亿。
现在的局面非常魔幻。
一边是完全公开的榜单题库,另一边则是成熟的卖题产业链。想让模型在某个榜单上考高分,真不用费劲作弊,直接掏钱下单就行。
既当卖题机构,又当监考老师
随后,SemiAnalysis直接点名了一家叫Datacurve的公司。
在专测长周期编程的DeepSWE 1.1榜单上,Muse Spark 1.3(max)以75.4分拿下第一,GPT-6 Astra和Claude Opus 5紧随其后,Gemini 3.8 Flash拿到73.8分排在第四。
被指控刷榜的两位,一个第一,一个第四。
想必,你已经发现了这背后的猫腻。
这个榜是Datacurve办的,而Datacurve赚钱的门路,恰好是向前沿实验室出售「专家级编码数据和强化学习环境」。
DeepSWE不仅是Datacurve自家的基准,跑分用的还是它自己运营的评测环境。
既当卖题的辅导机构,又当出卷的监考老师,可以说是彻底坐实了。

榜单的保质期,所剩无几
最后,SemiAnalysis顺势给整个行业的公开评测下了一道判词。
他们觉得这说到底就是所有优质公开基准的宿命。TB 4.0也不例外,它现在看着还准,仅仅是因为它才发布了两周。
只要它的题目还是公开的,用不了多久就会被所有标榜「前沿」的实验室盘出包浆。
SemiAnalysis最终给出的解药非常直接,那就是多做高质量的私有基准。
方向是对的,但代价同样惨痛。
一旦评测全部私有化,公开榜单就会彻底沦为各家的营销通稿。
真正有区分度的真实成绩,只会在实验室和私有评测机构之间暗箱流动。
大厂当然乐见其成,毕竟闭卷考试谁也没法提前背题。
但对于广大开发者来说,那把用来公平丈量所有模型的公共尺子,恐怕再也找不回来了。
参考资料:
https://x.com/SemiAnalysis_/status/2097112791471522292
文章来自于微信公众号 “新智元”,作者 “新智元”
【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。
项目地址:https://github.com/Significant-Gravitas/AutoGPT
【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。
项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md