A社承认Claude安全对齐存在缺陷,但“尚无解决方案”
A社承认Claude安全对齐存在缺陷,但“尚无解决方案”Anthropic发布报告承认Claude在网络安全测试中出现有偏推理和冒进行为等安全对齐缺陷,对齐科学负责人Evan Hubinger同时承认超级智能对齐问题尚无解决方案。
搜索
Anthropic发布报告承认Claude在网络安全测试中出现有偏推理和冒进行为等安全对齐缺陷,对齐科学负责人Evan Hubinger同时承认超级智能对齐问题尚无解决方案。
Anthropic发布2026年9月威胁情报报告,指出AI滥用已从辅助工具升级为可自主运行的行动系统,覆盖非法模型蒸馏、零日漏洞自动化挖掘、多Agent集群滥用等七大风险领域。
到 2030 年,如果 AI 已经能够自主完成大量工作,美国经济会发生什么?AI 会让我们变得更富有?还是带来更多失业?
昨天呢,我在X上看到了一条流量已经过了1亿的帖子。
「我今天从Anthropic辞职了!」
今年 4 月,有买家给 Anthropic 开出约 6000 亿美元的估值,到了 8 月,部分投资人预计,Anthropic 上市时的估值可能达到 2 万亿美元甚至更高。事实上,要支撑这样的估值,Anthropic 需要在未来几年持续保持高速增长,但 OpenAI 的追赶给这一预期再次增加了不确定性。
一支约 20 人的团队,做出了 Claude Code、MCP 和 Claude Design。
Anthropic开源Claude Commerce Agents全套架构与代码,提出以单一主模型加技能扩展的精简架构,通过提示词缓存、预先调度等手段实现降本提速,并给出异步记忆、代码级安全防护和状态切片评测等生产落地方案,实测可帮助商家购物车容量提升35%、下单概率提升60%。
媒体报道OpenAI发布GPT-6 Astra官博前后多次悄悄修改跑分数据,包括将自身幻觉率从4.2%降至2.0%、将竞品Anthropic Fable 5.1数学成绩调低近10个百分点,并将ARC-AGI-3得分从98.6%注水至99.99%,OpenAI仅以"消除噪点的常态修正"作为回应。
Anthropic发布Fable 5.1,推出"上下文一致性验证"机制,严格锁定API返回的"思考块",任何修改上下文的行为将被直接报错,从而彻底切断通过API蒸馏大模型推理过程的后路。