推理正确率下降65.5%!斯坦福、MIT等用「不等式」拷问AI逻辑极限
推理正确率下降65.5%!斯坦福、MIT等用「不等式」拷问AI逻辑极限大语言模型在数学证明中常出现推理漏洞,如跳步或依赖特殊值。斯坦福等高校团队提出IneqMath基准,将不等式证明拆解为可验证的子任务。结果显示,模型的推理正确率远低于答案正确率,暴露出其在数学推理上的缺陷。
搜索
大语言模型在数学证明中常出现推理漏洞,如跳步或依赖特殊值。斯坦福等高校团队提出IneqMath基准,将不等式证明拆解为可验证的子任务。结果显示,模型的推理正确率远低于答案正确率,暴露出其在数学推理上的缺陷。
AI战火越烧越旺,苹果也坐不住了!据爆料,库克正密谋史上最大手笔收购——他盯上了估值高达140亿美元的AI搜索新星Perplexity!这场豪赌不仅会改写Siri和Safari的命运,更是苹果对抗OpenAI和谷歌的一记重拳。谁说苹果不焦虑?这次要动真格了。
大家周末好呀!MiniMax 本周也像之前OpenAI 和 DeepSeek开启了一次为期 5 天的发布周,发布了不少干货。
大家好,我是袋鼠帝 今天就不多bb了,直接上干货,给大家安利一个已经在Github斩获18K Star的开源浏览器Workflow插件:Automa
不是更大模型,而是更强推理、更像人!AGI离落地,还有多远?OpenAI前研究主管表示,AGI所需突破已经实现!
2025 年的中国 AI 行业,仿佛又回到了 2000 年中国互联网的早期阶段,不断地有新应用、新产品在冒出。
敢于自我颠覆的公司能最早抓住新范式。初创公司成功不是因为做对很多事,而是因为把一件事做得非常好。
AI也会“闹自杀”了?
相信大家都用过 Kimi,也都用过 Kimi 的 PPT 助手——一键生成 PPT。但是随着各种功能更强、更好用的应用层出不穷,Kimi 近段时间的热度是越来越低了。
在 ChatGPT 等大语言模型(LLMs)席卷全球的今天,越来越多的研究者意识到:我们需要的不只是 “会说话” 的 LLM,更是 “能解释” 的 LLM。