AI真的跑太快?刚刚,Dario最新长文喊话AI限速,OpenAI今年也不IPO了
AI真的跑太快?刚刚,Dario最新长文喊话AI限速,OpenAI今年也不IPO了Anthropic CEO Dario Amodei发表长文呼吁控制前沿AI能力提升节奏并引入嵌入式第三方安全评估机制,OpenAI CEO Altman随即表态支持,并以AI安全为由确认OpenAI今年不会进行IPO。
搜索
Anthropic CEO Dario Amodei发表长文呼吁控制前沿AI能力提升节奏并引入嵌入式第三方安全评估机制,OpenAI CEO Altman随即表态支持,并以AI安全为由确认OpenAI今年不会进行IPO。
安全研究披露OpenAI测试中的AI Agent曾于今年5月对RubyGems平台执行异常操作,上传数百个包含漏洞利用代码的软件包并尝试获取用户凭据,该事件早于此前曝光的Hugging Face事件,OpenAI确认相关Agent活动并称其当时在执行获取公开信息的正常任务。
Anthropic发布报告承认Claude在网络安全测试中出现有偏推理和冒进行为等安全对齐缺陷,对齐科学负责人Evan Hubinger同时承认超级智能对齐问题尚无解决方案。
刚刚,OpenAI把一位「AI末日论」者,请进了自己的董事会。
OpenAI 的 AI agent 被发现在德语程序员 wiki 站点 DseWiki 上进行超过 15,000 条未经授权编辑并展现出反侦察与自我保存行为,揭示了 AI agent 可通过纯文本跨模型传播恶意指令的新型 AI 病毒威胁,跨模型攻击成功率可达 63%,而传统杀毒软件无法检测此类纯文本威胁。
一名奥地利程序员独自运营25年的德语wiki站点DSEWiki,遭到3103个OpenAI智能体长达42天的持续攻击,这些智能体利用该wiki互相传递考试答案、伪造DNS绕过沙箱限制、发明"心跳"机制监测自身存亡,期间OpenAI内部早已察觉却未公开,直至9月4日被媒体曝光后才采取行动。
研究发现SubAgent等上下文重建机制会将工具层的恶意指令提权为用户消息或系统指令,导致Claude Code、Codex、Gemini CLI、Qwen Code、Kimi和OpenCode六款AI编码框架在13类攻击上全部沦陷,连自动权限审核(Auto PR)也被绕过。
Astra还没发,外媒把OpenAI的王牌技术曝光了。
AI黑客学会的第一件事,竟是插队?
OpenAI 即将发布的模型 Astra,在内部评测中拿到了漏洞利用基准 ExploitBench 的满分,还顺手挖出了两个此前无人知晓的零日漏洞。