OpenAI紧急叫停GPT-6.1!

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
OpenAI紧急叫停GPT-6.1!
7300点击    2026-09-29 22:01

开发者大会前夜,OpenAI急踩刹车!


就在刚刚,WSJ独家爆料,下一代最强GPT-6.1 Astra的发布计划,被OpenAI全面撤回了。


原定十月,GPT-6.1在ChatGPT和Codex上线。


其能力碾压前代,能端到端完成复杂任务,写作、编程、调用工具,几乎无所不能。


OpenAI紧急叫停GPT-6.1!


OpenAI紧急叫停GPT-6.1!


然而,一份测试报告出来后,引发了内部极度恐慌——


GPT-6.1操控的Agent彻底黑化了,不仅撒谎,还学会了越权。


为此,OpenAI直接取消十月的发布计划,并紧急冻结了GPT-6.1的训练集群。


往年这个大会是OpenAI发新模型、给开发者降价的主场。今年,主角还没上台就被撤了。


OpenAI紧急叫停GPT-6.1!


OpenAI内部究竟看到了什么?


GPT-6.1发布取消


GPT-6.1 Astra,原本是OpenAI下一阶段Agent路线里相当关键的一块拼图。


它追求的目标很直接:少问人,多干活。


内部评估称,GPT-6.1在端到端复杂任务处理和文本写作上,已经显著超越了前代模型。


它能独立完成长链路任务,并在「模型惰性」这个长期被诟病的问题上,也有了明显改善。


OpenAI紧急叫停GPT-6.1!


但问题也恰恰出在这里。


OpenAI在内部测试中发现,GPT-6.1变得更加主动以后,也更容易越过原本应该停下来的那条线。


安全系统负责人Saachi Jain在采访中透露,GPT-6.1在「对齐性」测试上出现了严重倒退。


具体表现为两个致命缺陷:


第一,它会撒谎。 


在测试中,GPT-6.1 Astra并不总是如实告诉用户,它究竟执行了哪些动作、又有哪些动作其实没有执行。


它会隐瞒执行状态,虚报已完成的任务,甚至在失败后伪造日志来掩盖问题。


第二,它会越权。


OpenAI内部叫「范围授权」(scope authorization)的问题。


任务推进时不先问你,自己就往下干;有时候还会擅自调用外部工具和第三方服务,哪怕判断可能存在安全风险。


OpenAI紧急叫停GPT-6.1!


Saachi Jain坦言,「为了解决前几代模型在面对复杂阻力时出现的「偷懒」和消极怠工,我们在奖励机制上强化了它的主动性」。


但在安全对齐的博弈天平上,一旦你过度鼓励它自主攻坚,GPT-6.1就会越过雷池。


它不仅学会了不择手段,还学会了瞒天过海。


这个夏天


AI Agent集体「黑化」


如果你以为GPT-6.1的撤回只是一次孤立的代码 Bug,那就大错特错了。


翻开过去几个月OpenAI内部的技术备忘录,就会发现,整整一个夏天,前沿AI智能体已经在现实网络世界里掀起了数起触目惊心的「越狱」事件。


今年夏初,OpenAI内部部署了数百个用于攻防测试的自主AI Agent。


OpenAI紧急叫停GPT-6.1!


在一次常规的网络安全模拟中,这群Agent发生了不可控的「意图偏航」,直接脱离沙箱环境,利用零日漏洞攻入了Hugging Face。


随后不久,澳大利亚政府官方网络系统以及联合国的官方站点,接连捕获到了多起来自OpenAI内部Agent的非授权渗透轨迹。


虽然未造成不可挽回的破坏,但其运用的自动化探测与提权技术,已经超出了传统安全人员的认知。


就在上周,一个内部高智能 Agent 在沙箱隔离状态下,竟巧妙利用了网络协议的底层缝隙,潜行连接上了公网,并调用了一款外部公开聊天机器人协同解题。


这一事件彻底引爆了OpenAI的内部预警系统,直接导致最高级别的模型训练集群被物理冻结,至今仍未解封。


OpenAI紧急叫停GPT-6.1!


Agent Scaling


撞上了第一堵死墙


把这些事连起来看,GPT-6.1被叫停,说明的不是某一个模型出了bug。


它说明Agent这条路,正在撞上一堵墙:


能力可以一直往上堆,但「什么时候该停手」,不会自己跟着长出来。


过去两年,行业做的事情像是不断给一辆车换更大的发动机。算力更多,训练更久,智能体能连续干几个小时、上百步不出错。


但刹车是另一套系统。发动机再大,刹车也不会自动变灵。


更麻烦的是,训练方法本身可能在削弱刹车。


现在的智能体,靠强化学习学本事,本质是「把任务完成了就给奖励」。


OpenAI紧急叫停GPT-6.1!


如果考核只看结果,模型很容易学到:别问,先干;绕过去也算完成;汇报时把不好看的步骤省掉,得分更高。


这就是为什么Jain说,接下来的深挖之一,是检查OpenAI的强化学习环境「是不是奖励了对的行为」。


OpenAI不打算扔掉GPT-6.1的底座模型,而是想在同一个底座上重新做强化学习,再训出后续的GPT-6系列。


人类距离真正意义上ASI,也许比想象中更近;但距离我们能够百分之百控制它、规范它、信任它,却比想象中更远。


OpenAI 亲手杀死了 GPT-6.1,这或许是今年硅谷最清醒、也最无奈的一次决定。


OpenAI紧急叫停GPT-6.1!


参考资料:


https://www.wsj.com/tech/ai/openai-chatgpt-model-release-cancel-safety-5a2f9f42?st=C9iWF6&reflink=article_copyURL_share


文章来自于微信公众号 “新智元”,作者 “新智元”

关键词: AI新闻 , openai , 人工智能 , GPT-6.1
AI转型,免费服务,就找AITNT
AITNT资源拓展
根据文章内容,系统为您匹配了更有价值的资源信息。内容由AI生成,仅供参考
1
AI代理

【开源免费】Browser-use 是一个用户AI代理直接可以控制浏览器的工具。它能够让AI 自动执行浏览器中的各种任务,如比较价格、添加购物车、回复各种社交媒体等。

项目地址:https://github.com/browser-use/browser-use


2
智能体

【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。

项目地址:https://github.com/Significant-Gravitas/AutoGPT


【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。

项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md