OpenAI把AI推向物理世界,这家公司已造好引擎,下一站1000万小时人类经验
OpenAI把AI推向物理世界,这家公司已造好引擎,下一站1000万小时人类经验9 月 3 日,OpenAI 正式发布 GPT-6 Astra。在 ARC-AGI-3(一个考验 AI 能否在陌生环境中自主探索、理解规则并规划行动的 Benchmark),Astra 拿下 99.9%,并在 96% 的关卡中达到或超过人类的行动效率基准。
搜索
9 月 3 日,OpenAI 正式发布 GPT-6 Astra。在 ARC-AGI-3(一个考验 AI 能否在陌生环境中自主探索、理解规则并规划行动的 Benchmark),Astra 拿下 99.9%,并在 96% 的关卡中达到或超过人类的行动效率基准。
大模型过去几年的能力跃迁,几乎都围绕一个词:Scaling。
OpenAI发布的GPT-6 Astra在Insilico Medicine构建的DDD Benchmark抗体可开发性预测测试中以37.98分登顶第一,在不依赖外部专用工具的情况下击败所有前沿模型,标志着通用大模型正在突破抗体成药性预测这一生物医药研发的"死亡之谷",成为AlphaFold之后最具震撼性的科学范式转移。
《纽约时报》最新追访,补出了这场冲突中此前没有披露的细节。
我们自建的"你画我猜 Benchmark"第一期用150个词、1350张SVG画作对8款模型进行互画互猜测试,最终GPT-6 Astra以75.5分险胜Gemini 3.8 Flash与Claude Fable 5.1,结果显示思考更多或花费更多的模型并未稳定取得更高分,且部分模型连自己的画都认不出。
remove-ai-watermarks是支持一条命令去除AI生成图片明水印和C2PA文件信息层暗水印的开源工具,覆盖Nano Banana、豆包、即梦等多种水印,像素层SynthID暗水印需借助NVIDIA显卡跑invisible命令重绘去除。
因为一份Markdown,Claude Code可能要被踢出门了。最近,Shopify CEO Tobi Lütke突然在X上发话——我正在考虑禁止Shopify使用Claude Code。除非他们改主意,开始支持读取AGENTS.md和.agents/skills 。
模型的发布流程,早已在密集迭代中演变为精准的工业流水线:技术报告开路,Benchmark榜单刷屏,紧接着开放API,最后以开源权重收尾。
8 月 13 日,DeepSeek 开源 Agent Harness dsh,将 “Harness” 这个原本更偏工程语境的概念,推到了整个 AI 行业讨论的中心。
新智元报道 据传,下一代GPT-6本周就要来了! 这不刚在昨天,OpenAI「义父」Tibo亲自爆料,Codex将接入最强Astra模型。 消息一出,全网瞬间沸腾,人们期待值直接拉满。就连Polymarket上,关于OpenAI本周发布下一代Astra的概率,飙涨到了52%。