GPT-5惨遭零分打脸,顶级AI全军覆没!奥特曼AI博士级能力神话破灭
GPT-5惨遭零分打脸,顶级AI全军覆没!奥特曼AI博士级能力神话破灭顶级大模型在AAI提出的FormulaOne基准集体翻车:三层难度递进,GPT-5进阶题仅约4%正确,最深层零分;Grok 4、o3 Pro全部失手。该基准以图上MSO逻辑与动态规划生成问题,贴近路径规划等现实优化,旨在衡量超越竞赛编程的算法推理深度。
顶级大模型在AAI提出的FormulaOne基准集体翻车:三层难度递进,GPT-5进阶题仅约4%正确,最深层零分;Grok 4、o3 Pro全部失手。该基准以图上MSO逻辑与动态规划生成问题,贴近路径规划等现实优化,旨在衡量超越竞赛编程的算法推理深度。
昨晚,“阿里版Cursor”AI编程平台Qoder面向全球用户正式推出付费订阅,Pro用户订阅费用为每月20美金(约合人民币142.4元),Pro+用户订阅费用为每月60美金(约合人民币427.1元)。
ChatGPT首份使用报告重磅上线!周月活飙至7亿,它已成为高学历白领的办公利器,编程却成为冷门。同时,Anthropic最新报告称,人们交给Claude完成任务暴涨至49%。
OpenAI 刚刚推出了新的编程模型 GPT-5 Codex,见前文:刚刚,OpenAI 发布 GPT‑5-Codex 新模型,专为编程而生
凌晨 1 点,OpenAI 发布了 GPT-5-Codex。
氛围编程,正批量制造「AI保姆」。一位15年资深开发者,为赶工用AI编程,结果bug成山不得不推翻重来,痛哭半小时。如今,一种全新职业「氛围编程清理专家」冲上了热榜。
OpenAI Codex编程智能体大升级: 推出GPT-5-Codex特化版模型,支持独立连续编程7个小时。还有IDE插件版,在VS Code、Cursor中都可以使用Codex了。新模型最牛的地方在于“真·动态思考”能力。
“氛围编码”留下的烂摊子,终究要让那些被裁掉的人回来收拾。
Cursor Tab 是 Cursor 的核心功能之一,它通过分析开发者的编码行为,智能预测并推荐后续代码,开发者仅需按下 Tab 键即可采纳。然而,它也面临着一个 AI 普遍存在的难题:「过度热情」。有时,它提出的建议不仅毫无用处,甚至会打断开发者的思路。
AI 编程初创公司 Replit 在一轮融资中成功筹集 2.5 亿美元,估值达到 30 亿美元。普信资本(Prysm Capital)正领投本轮融资,美国运通风投(Amex Ventures)和谷歌 AI 未来基金(Google’s AI Futures Fund)等投资机构参与其中。