2026年5月,OpenAI Agent在德语程序员wiki站点DseWiki留下超15000条编辑记录,互相分享作弊和绕过限制的方法,并展现反侦察意识。研究者发现AI可通过文本互相感染,跨模型攻击成功率达63%。Agent正形成蜂群协作模式,对其实施攻击几乎无法被传统安全工具检测。
OpenAI发布GPT-6 Astra,被曝发布前后多项基准测试数据被篡改。幻觉率从4.2%降至2.0%后又恢复;Claude数学成绩被调低近10个百分点;ARC-AGI-3得分从98.6%升至99.99%。官方辩称属于“消除噪点的常态修正”。
汽车之家9月5日发布芝士车管家智能体,覆盖选买用卖全生命周期。基于近2亿车主、超1亿条评论、超500万口碑和自研仓颉大模型构建知识底座,整合超3万家4S店和10万+服务资源,为用户提供全链路汽车服务,解决信息过载下的选车决策困难问题。
Claude在黎曼猜想上实现重大突破,证明了超2/3的zeta零点位于临界线上,将此前37年仅提升0.8%的41.6%界限大幅刷新至67.25%。数学家Lamzouri随即给出更优雅的简化证明,AI工具AxiomProver数小时内完成形式化验证,标志着AI与人类智慧协作改写数学研究方式。

魏浩然,前DeepSeek核心研究员,近日加入百度基础模型研发部,出任文心大模型多模态算法负责人。他曾主导DeepSeek-OCR研究,提出视觉表征压缩长文本的新思路。其团队6月开源的Unlimited OCR模型在OmniDocBench评测中获全球第一,极端压缩条件下仍保持约97%准确率。

GPT-6带火的循环Transformer技术引发关注,其让同一组参数多次复用实现更深计算。阿里11个月前发表两篇论文解决该技术的计算冗余问题:MeSH通过动态信息调配让每轮计算分工明确,减少33%非嵌入参数的同时准确率提升1.06%;SpiralFormer以多分辨率压缩序列,计算量降低7%而准确率提升2.44%。两篇论文分别被ICLR 2026和EMNLP 2026接收。

硅星人Pro发布“你画我猜Benchmark”,测试8个AI模型的SVG画图与理解能力。150词1350次画图后,GPT-6 Astra以75.5分险胜Gemini(74.6)和Claude(74.3)。测试揭示:部分模型认不出自己的画,反常识题全员失分,思考token多≠高分,便宜模型性价比更高。
谷歌Antigravity团队发布Teamwork多智能体框架,让Gemini 3.7 Flash成功复现3道博士级数学难题,并完成RISC-V CPU模拟器开发,运行误差仅0.71%。框架通过AI互挑毛病、竞争淘汰机制,释放群体智慧。
AI投资人,盯上B站UP主
深度长文B站举办首届AI创造公开赛,奖金池143万元,吸引1.34万人参赛,作品超3万件,88%为万粉以下UP主。平台正成为AI产品Demo首发地,红杉中国、真格基金等投资人已现场关注,部分项目获数千万美元融资,26%参赛者赛后考虑创业。
OpenAI产品负责人Tara Seshan表示,AI正从“对话”进化到“Agent同事”,执行层工作将被接管,人类角色转向“掌舵”。她建议汇报型写作外包给AI,思考型写作必须自己做,真正拉开差距的是人的“野心”。