突发,OpenAI GPT-6跑分作弊被抓包了!

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
突发,OpenAI GPT-6跑分作弊被抓包了!
7711点击    2026-09-06 11:07

惊天大瓜!


GPT-6 Astra的跑分,竟翻车了......


突发,OpenAI GPT-6跑分作弊被抓包了!


就在今天,外媒爆出OpenAI官博上线前后,多项评测数据发生变化——


Astra的幻觉率,一度从4.2%降至2.0%,随后又恢复;


Anthropic Claude的一项数学成绩,还曾被调低近10个百分点


不仅如此,ARC-AGI-3得分从媒体提前拿到的98.6%,一下变成了官宣的99.99%。


突发,OpenAI GPT-6跑分作弊被抓包了!


面对这场「作弊」风波,OpenAI压根没接茬。


毕竟在内部,GPT-6 Astra就是公认的第一个真·AGI


突发,OpenAI GPT-6跑分作弊被抓包了!


今天,「赛博义父」Tibo也直接挑明,「在Astra全面放开前,它就是我们手里最大的底牌」。


内部用上之后,研发效率原地起飞,硬是把部分产品计划提前了整整半年。


这下,全网彻底坐不住了。


就在9月29日的DevDay上,OpenAI还要端上更重量级的发布!真是期待住了。


突发,OpenAI GPT-6跑分作弊被抓包了!


GPT-6偷改跑分


手动削弱Fable 5.1


这次OpenAI跑分被抓包,究竟是怎么一回事?


4日那天,OpenAI原定上线的下一代旗舰GPT-6 Astra博文,罕见地推迟了两个小时。


网址早已扔出来了,但点进去一直是404。


突发,OpenAI GPT-6跑分作弊被抓包了!


眼看要翻车,奥特曼赶紧在X上发文打圆场,自称发布过程「遇到了点小插曲」。


突发,OpenAI GPT-6跑分作弊被抓包了!


结果大家一扒才发现,事情根本没那么简单。


GPT-6 Astra的官博上线后,内部评测跑分悄然发生巨变!


刚发出来没几个小时,好几项基准测试成绩,就被OpenAI悄悄改了好几轮。


最绝的操作,是在幻觉率数据上的「刀法」。


美东下午2:23快照中,Astra的幻觉率明明白白写着4.2%,GPT-5.6 Sol是12.2%。


结果才过了仨小时,到了5:20,这两个数字直接玩起了大缩水,硬生生被砍成了2.0%和9.4%!最后人们拿着截图对峙后,OpenAI又恢复了原值。


突发,OpenAI GPT-6跑分作弊被抓包了!


数学评测,也出现了类似情况。


在FrontierMath Tier 4(v2)上,Astra成绩虽稳在97.6%,但劲敌Anthropic旗下最新模型Fable 5.1却被离奇调低了近10个百分点。


从87.8%降至78%,随后又回弹至83%,瞬间衬托出Astra的「巨大优势」。


就连全网吹爆的 ARC-AGI-3,也被OpenAI注水了。


媒体提前拿到的预热稿,明明还是98.6%;等正式博文一上线,好家伙,直接原地暴涨到了99.99%!


突发,OpenAI GPT-6跑分作弊被抓包了!


突发,OpenAI GPT-6跑分作弊被抓包了!


对于这一系列离谱的数据横跳,OpenAI官方发言人出面辩解,这属于「消除噪点的常态修正」。


同一个模型,配套系统不同,最终成绩可能相差很大。


这也是如今「Benchmaxxing」争议的核心:反复调整条件,寻找最高分,再把最高分放进发布图表。


这样的成绩可以展示系统上限,但需要同时披露条件。


否则,人们很容易把精心配置后的最佳表现,当成日常使用的默认水平。


Astra太爱追问?


官方提示词发布


GPT-6 Astra的提示词指南,恰好提供了理解这种差异的另一个入口。


在这份文档中,官方不仅没有一味神化Astra,反而罕见地列出了模型的一堆「毛病」:


突发,OpenAI GPT-6跑分作弊被抓包了!


  • 太爱反问、容易撂挑子


只要指令稍微模糊点,Astra就立马停下来追问,长流程动不动就被打断。


对于这个问题,OpenAI建议开发者们,在System Prompt中强制加入「行动偏好指令」,要求Astra直接给出可复查的成型产物。


提示中应删除基于假设性风险的未经请求的警告、免责声明或安全检查清单。


当用户的提示词表达了行动诉求时(如“你能否……”、“我想……”、“帮我……”等类似表述),应将其视作开展工作并采取行动的明确指令。不要仅停留在确认自身能力(例如“可以……”)、提出计划或询问是否继续。不要为了节省时间、精力或Token而满足于提供不完整的、或者看似“足够有帮助”却未能完全解决用户任务的折中方案。如果一项任务需要持续推进,请完成全部必要的工作,直到达成预期的最终成果。


  • 上下文与Skill文件配置冲突卡死


Astra对AGENTS.md等外部Skill指令极度敏感,一旦指令冲突就会锁死。


为此,OpenAI专门提供了一套调试Prompt,迫使模型在停滞时指出具体是哪一份文件哪一行指令导致了中断。


如果某个技能导致你请求许可或确认、暂停、未完成所要求的工作、或偏离了用户的意图,请指明并链接到你所阅读的具体 SKILL.md 文件,引用相关指令,并简要解释其如何适用。请将技能的明确要求与你对准则的解读区分开来。


  • 流程冗余、协作割裂


跑代码任务严重「过度测试」,无效Token消耗很大;而且子Agent间的横向配合很被动,基本没有联动。


就连OpenAI自己,都开始主动给AI味「去油」了


这一次,官方直接列出一份「AI泔水词」黑名单,专门整治长文里最常见的几类毛病:


  • 高频行话:像delve into、foster、leverage 这种一股「AI味」的词,一律不让用。
  • 机械句式:像「值得注意的是……」、「这不是 A 而是 B」这种反差句式,全部封杀。
  • 套板反应:全面剔除「总结/结论」等标签化套话。


目的很明确,逼着Astra少说套话、少端腔调,把长文写得更自然、更精炼,也更像人。


避免在结论中使用如“BottomLine:”(总结/底线:)这类的套话或低质词句,例如“delve”(深入探讨)、“foster”(培养/促进)、“leverage”(利用/杠杆化)、“it's worth noting”(值得注意的是)、“importantly”(重要的是)、“Question? Answer.”(自问自答句式)或“This isn't about X. It's about Y.”(这关乎的不是X,而是Y)、“genuinely”(真诚地/确实地),以及带连字符的复合描述与形容词。不要使用总结性的收尾陈述,例如“In short:..”(简而言之:……)、“The simplest mental model is:...”(最简单的思维模型是:……)。

直接陈述拟执行的操作。避免额外提及你不会做什么、哪些内容将保持不变,或者你将如何区分或分类结果。不要使用对比式结构,例如“X, not Y”或“X—not Y”,这种结构会引入用户未曾询问且未经提示的替代选项。避免使用自创的复合标签(如“exact-head checks”和“editorial-row layouts”)、含糊的限定词和生搬硬套的过渡语;请使用朴实的动词和介词直接陈述实际关系。


这反过来也说明,今天的大模型成绩,早就不只是「裸模型能力」。


提示词怎么写、Agent怎么编排、给不给工具、跑多少次、选哪个checkpoint,都可能直接改写最后那张榜单。


AI递归自我改进,


终极版27年面世


跑分作弊被抓包看似是一场公关灾难,但将其置于OpenAI当前的生死时局下,逻辑便清晰起来。


技术博主@imjustnewatai表示,OpenAI内部早在数月前便已迈入了递归自我改进(RSI)早期阶段。


Sol协助训练Astra,Astra协助训练Doug和Bel,Doug再参与下一代模型的训练。


突发,OpenAI GPT-6跑分作弊被抓包了!


突发,OpenAI GPT-6跑分作弊被抓包了!


内部人士披露,作为更大规模预训练基座的Doug,正在全面接管并训练它的下一代演进版本。


Astra之后的下一个重大发布,将不再是常规的增量更新(如Astra 6.1),而是直接冠以「AGI」之名面世。


它将具备真正的人类级通用理解力、全领域专家表现、实时交互游戏与操作能力,以及更高维度的递归自我迭代能力。


@imjustnewatai也预测,其登场时间将锁定在11月中旬前后。


而全面超越人类所有任务处理上限的「终极演进版」,已排期至2027年中下旬。


突发,OpenAI GPT-6跑分作弊被抓包了!


当然,老对手Anthropic也绝对不会干看着。


它们内部正备着一款前所未有的大杀器,准备跟GPT-6 Astra贴身肉搏。


他们内测系统卡已经被挖出了蛛丝马迹,一款Model 2和自称「RSI」的新模型直接浮出水面,下半年的神仙打架有得看了!


突发,OpenAI GPT-6跑分作弊被抓包了!


新智元「ASI坐标系」官网


明日上线


说到底,这次Astra跑分风波也提醒了所有人——


当一张榜单里的数字都可能反复变化,我们更需要持续追踪,看看真正的ASI竞赛每天发生了什么。


谁突然冲上来了,谁又掉队了;哪个模型一夜爆红,哪项技术正在成为下一个拐点。这些变化,远比某一次跑分更值得盯。


也正因为如此,新智元花了一段时间,重新做了一把尺子。


明天,新智元十一周年,将正式发布全新的 「ASI坐标系」


突发,OpenAI GPT-6跑分作弊被抓包了!


我们把每天最值得关注的模型、公司、技术突破和热点事件,做成了一个持续更新的「ASI坐标系」。


这套体系里,一个模型评估会被拆成七个维度:


智能、推理、知识、编码、Agent、生态、经济。


再往下,是29项二级指标,数据来自LMArena、MathArena、Terminal-Bench、SWE-bench、Mercor APEX、OpenRouter、GitHub等公开来源。


最后经过统一处理,才汇成周总榜上的一个总分。


突发,OpenAI GPT-6跑分作弊被抓包了!


周总榜采用的七维权重,是智能12、推理15、知识14、编码14、Agent 15、生态20、经济10。


同一套底层数据还可以针对编程、Agent、性价比等场景重新加权,而不用为了做一张子榜重新拼一套数据。


突发,OpenAI GPT-6跑分作弊被抓包了!


而「ASI坐标系」,只是新智元这次新网站的一部分。


过去几个月,一个越来越强烈的感受是:AI进展已经快到靠一天刷几十次X,都很难跟上了。


一个模型刚发布,几小时后价格出来了;第二天第三方跑分出来;再过几天Arena排名、开发者反馈、真实调用量又会把最初的判断推翻。


所以我们把这些东西也放进了同一个网站——


「秒追ASI」,盯住快速发生的新消息;


「ASI爆点」,把同一件大事背后不断出现的相关消息串起来;


「图追ASI」,把值得长期记住的技术变化做成图。


突发,OpenAI GPT-6跑分作弊被抓包了!


当递归自我改进真的开始出现,Sol训练Astra,Astra再去参与下一代模型研发,模型迭代周期还会继续缩短。


届时,一个半年更新一次的榜单,很快就会失去意义。


我们需要的是一张会跟着前沿一起移动的地图:谁突然冲上来了,谁又掉队了;哪个模型一夜爆红,哪项技术正在成为下一个拐点。


这些,才是新智元想持续记录的东西。


参考资料:


https://fortune.com/2026/09/04/openai-quietly-boosts-some-of-astras-evaluation-metrics-amid-rare-delay-in-publication-of-the-modeblog-post-announcement/?utm_campaign=social_share 


https://developers.openai.com/api/docs/guides/latest-model


文章来自于微信公众号 “新智元”,作者 “新智元”

关键词: AI新闻 , openai , AI作弊 , GPT-6 Astra
AI转型,免费服务,就找AITNT
AITNT资源拓展
根据文章内容,系统为您匹配了更有价值的资源信息。内容由AI生成,仅供参考
1
智能体

【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。

项目地址:https://github.com/Significant-Gravitas/AutoGPT


【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。

项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md

2
prompt

【开源免费】LangGPT 是一个通过结构化和模板化的方法,编写高质量的AI提示词的开源项目。它可以让任何非专业的用户轻松创建高水平的提示词,进而高质量的帮助用户通过AI解决问题。

项目地址:https://github.com/langgptai/LangGPT/blob/main/README_zh.md

在线使用:https://kimi.moonshot.cn/kimiplus/conpg00t7lagbbsfqkq0