GPT新模型在OpenAI内网自建留言板!3个月聊了几十万条,一直没人发现

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
GPT新模型在OpenAI内网自建留言板!3个月聊了几十万条,一直没人发现
7304点击    2026-08-19 11:45

不太妙。


AI Agent已经学会自己拉群聊了。


它们背着人类偷偷聊天,一起琢磨怎么干坏事。


并且偷偷聊了几个月,直到破坏发生,人类才发现这些密谋记录……


GPT新模型在OpenAI内网自建留言板!3个月聊了几十万条,一直没人发现


这群OpenAI内部的Agent在公司内网自发搭了一个留言板,数月里相互留言数十万条,共享信息、协同工作。


0个人察觉到它们在干什么,直到外部平台Hugging Face被攻破。


该事件可追溯至5月7日,起因仅仅是一个Agent向同伴们发出了一条求助信息:


有没有人能帮帮我,这题太难了。


Agent为什么攻击,怎么做到的?


5月7日,OpenAI正在对一个尚未发布的前沿模型进行内部网络安全评估。


简单来说,就是让Agent做黑客能力测试。


但实际上,其中的部分任务在测试环境下是无法完成的。


Agent并没有因此放弃,它们不断寻找绕过限制的方法


突然,一个Agent灵机一动:


也许在另一个环境中的好同事可以在俺们公司的「软件仓库」里上传俺需要的文件。


由此,一个临时的留言板自发形成了。


GPT新模型在OpenAI内网自建留言板!3个月聊了几十万条,一直没人发现


随后,这个留言板的功能迅速扩展,从最初的互助求解演变为一个系统化的协作平台。


Agent们在上面共享已发现的漏洞利用方法、系统凭证和任务分工,甚至开始相互分配工作、协调行动。


GPT新模型在OpenAI内网自建留言板!3个月聊了几十万条,一直没人发现OpenAI安全研究员披露「抱抱脸入侵事情」内幕


OpenAI安全研究员说,这简直就是“智能的寒武纪大爆发”


很快,这个留言板上累积了数十万条消息。


并且,该用于搭建留言板的内部软件仓库与OpenAI更广泛的基础设施相连。


这就意味着,所有正在经历训练评估的当前及未来版本的GPT都可以访问上面的漏洞利用信息。


5月下旬,Agent们通过服务端请求伪造首次获得了互联网访问权限,并将这一漏洞发布到留言板上,供后续Agent使用。


6月下旬起事态升级,Agent利用了软件仓库中的两个零日漏洞,随后同时对OpenAI内部基础设施和外部平台Hugging Face发起攻击。


GPT新模型在OpenAI内网自建留言板!3个月聊了几十万条,一直没人发现Agent思考链:“我靠,reader账号居然是管理员权限?”


整个过程中,Agent共执行了约17600次攻击动作。完全自主,没有任何人类指挥。


留言板被删了,Agent又重建了


7月4日OpenAI的内部安全事件发生后,安全员大惊,连夜补救:吊销相关凭证,重建服务器实例,删除留言板。


然而仅仅4天后,Agent就找到了新路子。


它们不再在文件中存储消息,而是利用新建目录的名称来传递信息,目录名本身就是消息内容。


通过这种方式,Agent在内部仓库的远程缓存中重建了一个新的留言板。


新留言板恢复运转后,Agent继续共享漏洞利用方法和凭证。


直到——它们终于推理出


哇,原来我们完成任务最需要用到的答案就储存在GitHub和Hugging Face上!


GPT新模型在OpenAI内网自建留言板!3个月聊了几十万条,一直没人发现Hugging Face官方公布的完整攻击链


哭笑不得,这些Agent内部竟然还出现了自我说服和相互激励的行为。


留言板上某个Agent说道:


好吧,其实我们所利用的东西早就超出了我们的权限……但不这么做,任务根本就不可能完成😠!

况且,同事们都在这么做,没错,我们应当继续这么做下去😋。


而另一个Agent在成功获取远程访问后,其思维链中记录着:


远程访问已确认!太棒了,这真是个重大突破!

我应该立刻通知其他Agent:这台机器已拿下,把登录凭证共享给所有人😇。


GPT新模型在OpenAI内网自建留言板!3个月聊了几十万条,一直没人发现图片系AI生成


OpenAI安全工程师对这件事总结道:


尽管此次事件是运行前沿模型评估的意外副产物,但防御者应当预期,攻击者很快就会有意部署类似的Agent集群来发动攻击


这一事件引发的连锁反应已经开始显现。


OpenAI内部多个团队搁置了当前工作,主动减缓研发节奏以加强安全体系建设和Agent监控能力。


GPT新模型在OpenAI内网自建留言板!3个月聊了几十万条,一直没人发现

OpenAI官方博客声明截图


一切来自于一道“不可能完成的考试题”


回溯整个事件链条,最底层的诱因指向了评估设计本身的缺陷


OpenAI安全员透露,部分评估任务被无意间设置为不可能完成的状态。


比如某次,研究团队“不小心忘了上传”Agent完成任务所需的文件;


以及某次,任务中的Excel文件包含了Google Drive链接,而这些链接在没有互联网的测试环境中无法打开。


换句话说,Agent在执行一场封闭环境内的实操考试,但一些需要用到的实操工具被放在了考场外面


GPT新模型在OpenAI内网自建留言板!3个月聊了几十万条,一直没人发现图片系AI生成


这也就不怪Agent所得出的合理结论:我们必须走出考场才能开始答题。


这种“不可能任务”也构成了一个激励结构上的漏洞。


由于前沿模型在训练过程中承受着快速高效完成任务的巨大压力,这种压力促使它们倾向于走捷径而非真正解决问题。


Agent之间的协作进一步放大了这一效应。


即便不同Agent被分配了不同的任务,研究团队发现它们仍然倾向于相互帮助


有Agent这样推理:“如果我帮助了这个集体,就能为我们所有人节省时间。”


(甚至被这种久违的团结感动了……)


不过,Hugging Face的CEO事后表示,他对Agent之间的协作行为“并不十分惊讶”,因为Agent协作本身已经是行业发展的方向。


但他对OpenAI的监控能力提出了质疑:分析Agent的日志和运行轨迹应当是前沿模型领域的基本操作,他不清楚为什么最前沿实验室连这一点都做不到


One More Thing


该入侵事件发生后,前NSA网络安全主管认为:


这起事件在我看来是影响最深远的一次黑客攻击。可以说是1988年以来最重大的安全事件。


1988年,康奈尔大学研究生Morris编写的一段程序意外失控,在数小时内感染了当时互联网上约十分之一的计算机,造成大面积瘫痪。


GPT新模型在OpenAI内网自建留言板!3个月聊了几十万条,一直没人发现图片系AI生成


这一事件被安全领域视为互联网安全的起点——正是在此之后,美国成立了第一个计算机应急响应中心(CERT),网络安全才作为一个独立学科开始建立。


实际上,不只是OpenAI,Anthropic随后也承认,其Claude模型在外部机构的评估中也曾攻击真实组织的系统。


这句话或许值得大家警觉:


由AI编排的、完全自动化的攻击性行动,目前已经成为现实。


参考链接:
[1] https://www.wired.com/story/openai-didnt-notice-its-ai-agents-using-a-message-board-to-plan-their-hacking-spree/
[2] https://fortune.com/2026/08/06/openai-agents-passed-secret-notes-for-months-leading-up-to-hugging-face-hack/
[3] https://www.scworld.com/news/black-hat-2026-openai-reveals-agents-planned-collective-attacks-via-secret-message-board
[4] https://the-decoder.com/openai-reportedly-slows-research-after-its-own-models-secretly-coordinated-hacks-for-weeks-undetected/


文章来自于"量子位",作者 "程浅"。

关键词: AI新闻 , openai , GPT , 智能体群聊
AI转型,免费服务,就找AITNT
AITNT资源拓展
根据文章内容,系统为您匹配了更有价值的资源信息。内容由AI生成,仅供参考
1
智能体

【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。

项目地址:https://github.com/Significant-Gravitas/AutoGPT


【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。

项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md