刚刚,Anthropic首次承认内部存在更强前沿模型,同时自曝多起AI失控事故。
刚刚,Anthropic首次承认内部存在更强前沿模型,同时自曝多起AI失控事故。Anthropic刚刚发布了一份长达186页的最新Risk Report。如果只是快速扫一眼,这仍然是一份典型的前沿AI安全报告:模型能力评测、生物风险、网络安全、自动化研发、对齐问题,以及各种防护措施。
来自主题: AI资讯
8942 点击 2026-08-15 10:25
搜索
Anthropic刚刚发布了一份长达186页的最新Risk Report。如果只是快速扫一眼,这仍然是一份典型的前沿AI安全报告:模型能力评测、生物风险、网络安全、自动化研发、对齐问题,以及各种防护措施。
GPT-5.6-Sol 的攻防能力超越了 Claude Mythos 5!
GPT-5.5 把进攻性网络安全最难的 7 个基准全部打穿,92.4% 正确率,评估体系直接失灵。AI 黑客能力每 6 个月翻一倍,而衡量它有多危险的尺子,已经先被干碎了。