AI资讯新闻榜单内容搜索-Benchmark

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
搜索: Benchmark
深度|对话OpenAI推理教父:为什么说现有的Benchmark让我们严重低估了AI能力?

深度|对话OpenAI推理教父:为什么说现有的Benchmark让我们严重低估了AI能力?

深度|对话OpenAI推理教父:为什么说现有的Benchmark让我们严重低估了AI能力?

本期播客,No Priors 请来了一位在 AI 推理领域被业内称为「教父级」人物的研究者Noam Brown。他是 OpenAI 的研究科学家,也是推动「test-time compute scaling」成为行业主流方向的关键人物之一。从扑克 AI 到前沿大模型的评估方法论,Brown 的研究轨迹几乎与整个行业对「推理」认知的升级同步。

来自主题: AI资讯
5284 点击    2026-08-05 11:04
Workflow Gym:告别仿真测试,抹平Agent落地鸿沟

Workflow Gym:告别仿真测试,抹平Agent落地鸿沟

Workflow Gym:告别仿真测试,抹平Agent落地鸿沟

你可能已经在各种 benchmark 榜单上看过 GUI Agent 的 "大胜" 了。

来自主题: AI技术研报
6967 点击    2026-07-24 10:45
47.6%,阿里Qoder拿到了比跑分更硬的成绩

47.6%,阿里Qoder拿到了比跑分更硬的成绩

47.6%,阿里Qoder拿到了比跑分更硬的成绩

对 AI Coding 来说,有人用,比任何 Benchmark 都管用,而有人持续付费,又比有人用更管用。

来自主题: AI资讯
5896 点击    2026-07-16 14:45
3.8万小时、狂烧天价token:字节发现Agent的 Scaling Law

3.8万小时、狂烧天价token:字节发现Agent的 Scaling Law

3.8万小时、狂烧天价token:字节发现Agent的 Scaling Law

7月2日,字节 Seed 发布了一个 Agent评测项目 EdgeBench。看起来又是一个 benchmark,但它问了一个其他榜单不问的问题。EdgeBench 的切口就是把盲区里的东西放进评测,解答一个问题:把Agent扔进一个陌生环境,12小时后,你能变强多少?

来自主题: AI技术研报
8952 点击    2026-07-08 15:53
Claude、GLM、GPT谁才是真正的AI软件工程师?首个持续更新Visual Spec-to-App Benchmark发布

Claude、GLM、GPT谁才是真正的AI软件工程师?首个持续更新Visual Spec-to-App Benchmark发布

Claude、GLM、GPT谁才是真正的AI软件工程师?首个持续更新Visual Spec-to-App Benchmark发布

为了解决这一问题,来自 University of Arizona、Zoom 与 Stony Brook University 的研究团队推出了 VISTA(VIsual Spec-To-App Benchmark), 首个面向 Visual Spec-to-Web-App Coding Agents 的端到端 Benchmark。

来自主题: AI技术研报
8296 点击    2026-07-06 15:49
葬AI基准测试发布:GLM 5.2第一,超越Opus 4.8

葬AI基准测试发布:GLM 5.2第一,超越Opus 4.8

葬AI基准测试发布:GLM 5.2第一,超越Opus 4.8

这是葬AI起号以来工作量最大的一篇文章。为了严肃评测国产模型的能力,我自研了一个Benchmark,完整测试了智谱、Qwen、Kimi、Minimax、Deepseek这些最新国产模型,还引入了境外势力Claude作对照组。

来自主题: AI资讯
9482 点击    2026-06-17 13:30
我做了个测试 Claude API 中转站的 Skill,测完发现水太深了

我做了个测试 Claude API 中转站的 Skill,测完发现水太深了

我做了个测试 Claude API 中转站的 Skill,测完发现水太深了

根据我长期使用的观察,0.3 倍率说是用 Kiro 逆向出来的 Claude,2.0 倍率说是正经 Claude Max 号池接出来的。听起来后者肯定更靠谱。我一开始也这么想的。毕竟倍率差了快七倍,价格摆在那,总不至于拿假货糊弄人吧。

来自主题: AI资讯
14210 点击    2026-06-11 16:53
CVPR 2026|LLM会写3D视觉代码吗?清华联合智源用GeoCodeBench给出答案

CVPR 2026|LLM会写3D视觉代码吗?清华联合智源用GeoCodeBench给出答案

CVPR 2026|LLM会写3D视觉代码吗?清华联合智源用GeoCodeBench给出答案

近日,来自清华大学智能产业研究院(AIR)的团队联合北京智源研究院(BAAI)、北京大学、南京大学等机构构建了一个基准:GeoCodeBench。这是一个面向 3D 几何计算机视觉的 PhD 级 coding benchmark,

来自主题: AI技术研报
9889 点击    2026-06-07 10:54