老黄替OpenAI宣布AGI!出题人当场打脸:换个考场99.9%掉到62.7%

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
老黄替OpenAI宣布AGI!出题人当场打脸:换个考场99.9%掉到62.7%
7085点击    2026-09-11 16:00

上周四,OpenAI发布GPT-6 Astra。


官网给它的定性是「世界上最智能、最对齐的模型」。


紧接着,黄仁勋在X上发了一条帖子,把这件事推向另一个高度:


AGI已经到来。恭喜OpenAI团队。


老黄替OpenAI宣布AGI!出题人当场打脸:换个考场99.9%掉到62.7%


反观GPT-6 Astra的官方发布页,通篇找不到「AGI已实现」这样的字眼。


一个卖GPU的,替做模型的,把话说满了。


更有意思的,是出题的人。


OpenAI发布页写着Astra在ARC-AGI-3上拿到99.9%,「饱和」了这个以AGI命名的基准。


负责出卷子的评测机构ARC Prize看完跑分,却一把拒签:「不算。」


ARC Prize基金会当天就发文拆解:


这个分数来自OpenAI定制的测试环境,换成对所有厂商一视同仁的标准环境,只有62.7%。


他们的结论只有一句:Astra在泛化上有实质进展,「但我们不宣称它是AGI」。


芯片供应商直接盖章,模型厂商留了余地,负责出题的基准机构直接拒签。


这大概是过去几天AI圈最魔幻的一幕:AGI这次没有被真正「实现」,而是被各方代言人在社交平台上「宣布」了。


OpenAI自己怎么说?


在发布当天的记者电话会上,总裁Greg Brockman说了一句极具煽动性的话:


欢迎来到AGI时代。


他甚至预言,如果几年后回头看AGI是何时诞生的,「大概就是这个时期,可能就是这个模型。」


听起来像官宣?


但他立刻又补了两个限定词:第一,这是他「个人判断」;第二,AGI是个灰色、模糊的概念,「到底算不算,由用户自己决定。」


老黄替OpenAI宣布AGI!出题人当场打脸:换个考场99.9%掉到62.7%


在自家最重要的产品发布会上,总裁居然用「个人看法」来给时代定调,甚至还把最终裁定权甩给了网友。


这只能说明一件事:OpenAI内部,也拿不出一份明确、能公示的AGI认定书。


更有意思的是CEO奥特曼的态度。


在Astra发布前,他曾公开吐槽「AGI」是个定义糟糕、接近营销术语的词。


CEO嫌这个词太虚,总裁拿它当「个人看法」,官网干脆闭口不提。


黄仁勋那句AGI的「盖章」和恭喜,恰好就落在了这个微妙的空白里。


99.9%与62.7%


同一张卷子的两套成绩


Astra到底强不强?


OpenAI发布页上写着:


Astra在以AGI命名的基准测试ARC-AGI-3上拿到了99.9%的逆天高分,「饱和」了这个测试。


但打脸来得也快。


当天,负责出题的ARC Prize基金会就发文,把这个「99.9%」当众拆解了。


原来Astra考了两次。


老黄替OpenAI宣布AGI!出题人当场打脸:换个考场99.9%掉到62.7%


ARC-AGI-3榜单,Astra两套环境的成绩分开标注;同榜Claude Opus 5为30.2%,GPT-5.6 Sol为7.8%。


在OpenAI深度定制的「自带工具」环境下(允许模型保留推理状态、用独家技术管理长对话),它确实考了99.9%,花了近1.9万美元。


但如果换成对所有厂商一视同仁的「裸考」标准环境,它的最高分其实只有62.7%,成本更是飙升到2.6万美元。


ARC Prize的态度很坚决:未来的AGI,必须能在标准条件下解题。带工具拿到的99.9%和裸考拿到的62.7%,完全是两码事。


当然出题人也承认Astra带来了「阶跃式」的惊喜,在96%的关卡里,Astra用的动作数比人类还少,平均少用51.7%。


这是AI第一次在动作效率上全面碾压人类。


可ARC Prize早就把话说在前头:ARC-AGI-3上线那天他们就写明,刷满这个基准不等于「证明达到了AGI」。


理由很简单:测试环境再难也是封闭的,机制确定、目标封闭,代表不了真实世界的复杂与开放。


就像一个学霸,卷子考了满分,到了真实职场未必依然能够开挂。


10万颗炼模型


40万颗卖未来


既然出题人都不认,老黄为什么最急着宣布「AGI已到」?


仔细拆解黄仁勋的那条帖子,你会发现它的信息结构比表面热闹得多。


帖子全文是:


GPT-6 Astra,在约10万颗NVIDIA Grace Blackwell NVLink72上训练。从ChatGPT到o1再到Astra,只用了4年。AGI已经到来。恭喜OpenAI团队。接下来还有40万颗GPU上线。


第一个数字:10万颗。


Astra是OpenAI迄今规模最大的一次训练,用掉了超过10万颗GPU。


第二个数字:4年。


从ChatGPT到o1再到Astra,黄仁勋用一条时间线,把对话模型、推理模型和所谓的AGI连成了一条直线。


第三个数字:40万颗。


「接下来还有40万颗GPU上线。」


这40万颗归谁?什么型号?用来干嘛?黄仁勋在这里留下了悬念。


但当这三个数字与「AGI已到」被塞进同一条帖子里时,读者脑海中就会出现这样一种商业叙事:


10万颗GPU砸出了Astra(也就是AGI),那接下来的40万颗会砸出什么?


在这个语境下,AGI不再是一个抽象的技术终点,而变成了一份最有力的算力需求证明。


一旦AGI被公认「已到」,天价的算力就不再是企业的成本项,而是谁都不敢下牌桌的必需品。


推特上的AGI


进不了商业合同


去年10月,OpenAI和微软的新协议里写了一条:OpenAI宣布AGI之后,还得由一个独立专家小组核验。


老黄替OpenAI宣布AGI!出题人当场打脸:换个考场99.9%掉到62.7%


今年2月两家又联合重申,合同里AGI的定义和认定流程「均保持不变」。


到了4月,协议再度修订,微软的收入分成改为「与OpenAI技术进展无关」,外界普遍解读为AGI条款对商业利益的触发作用已经大幅弱化。


也就是说,Brockman在记者会上说什么、黄仁勋在X上写什么、ARC-AGI-3跑了多少分,都不构成合同意义上的AGI认定。


眼下正是OpenAI筹备IPO的关键节点,死对头Anthropic也在冲刺上市。


「AGI」这个词早已写进了OpenAI与微软、亚马逊的投资协议里,它牵动的已经超出技术信仰,还有股权定价和商业控制权。


这就能解释,为什么Brockman只敢说是「个人判断」,为什么OpenAI官网严防死守不提AGI。


舆论场上可以尽情欢迎AGI时代,落到合同里,一个字都不能多写。


谁有资格宣布AGI?


Bloomberg一篇长文把这个问题捋了一遍,答案是没人说了算。


老黄替OpenAI宣布AGI!出题人当场打脸:换个考场99.9%掉到62.7%


先看定义。


OpenAI的版本是「在大多数具有经济价值的任务上超越人类的系统」。


谷歌DeepMind 2023年的论文不看经济价值,看通用性,看能不能用很少的数据学会新技能。


ARC Prize更直接,说经济价值「是衡量智能的错误尺度」,他们的定义是「能高效习得训练数据之外新技能的系统」。


连词也都不一样。


Anthropic的Dario Amodei不爱说AGI,改叫「强大人工智能」(powerful AI)。微软的Mustafa Suleyman造了个「可用人工智能」(artificial capable intelligence)。


Meta和OpenAI最近干脆跳过AGI,直接谈「超级智能」(superintelligence)。


时间表更乱。


2024年9月,奥特曼说「指向AGI的系统正在显现」,甚至说「几千天内」可能有超级智能。


老黄替OpenAI宣布AGI!出题人当场打脸:换个考场99.9%掉到62.7%


一年后GPT-5发布,他承认「我们还缺一样相当重要的东西」,但没说缺什么。


再一年,Brockman在Astra发布会上说「欢迎来到AGI时代」。


DeepMind那边,Shane Legg从1999年起就押2028年前实现AGI的概率是50%;Demis Hassabis却说还要五到十年,时间线看起来在缩短,只是因为「AGI的定义正在被稀释」。


于是就出了眼下这个局面。


同一个词,四拨人用四种方式定义它。


模型公司握着产品叙事,只晒跑分不下定论;


芯片巨头握着算力叙事,急着宣布时代降临;


基准机构握着测试标尺,死死咬住底线,不承认;


微软这样的大金主握着合同条款,稳坐钓鱼台,按规则算账。


过去四年,全行业争的是谁最先做出AGI。


最近,叙事时态变了,从「还要一到三年」「最快半年」,直接跳到「已经到来」。


可一套公认的AGI验收标准,至今没人拿得出来。


参考资料:


https://x.com/JensenHuang/status/2096700264569090384


https://www.bloomberg.com/news/features/2026-09-04/what-is-agi-openai-anthropic-race-for-artificial-general-intelligence


https://www.axios.com/2026/09/03/openai-astra-gpt-6-agi-brockman


文章来自于微信公众号 “新智元”,作者 “新智元”

AI转型,免费服务,就找AITNT