字节系之外,RunningHub突围:顶级AI模型争夺“首发阵地”
字节系之外,RunningHub突围:顶级AI模型争夺“首发阵地”模型的发布流程,早已在密集迭代中演变为精准的工业流水线:技术报告开路,Benchmark榜单刷屏,紧接着开放API,最后以开源权重收尾。
搜索
模型的发布流程,早已在密集迭代中演变为精准的工业流水线:技术报告开路,Benchmark榜单刷屏,紧接着开放API,最后以开源权重收尾。
8 月 13 日,DeepSeek 开源 Agent Harness dsh,将 “Harness” 这个原本更偏工程语境的概念,推到了整个 AI 行业讨论的中心。
最近,葬AI和我们的朋友钟经纬、正阳一起,推出了懂模帝这个产品,现在任何人都可以登陆 fuckai.md 去看各种各样的benchmark。
2026 年 3 月,轨道数据中心公司 Starcloud 宣布完成 1.7 亿美元 A 轮融资,由 Benchmark 与 EQT Ventures 领投,估值达到 11 亿美元,累计融资额达到 2 亿美元。
近日,浙江大学 OmniAI 团队在 《Show, Don’t Tell: Evaluating Spatial Cognition in Generative Pixels Rather Than LLM Text》 中提出 ProVisE,让图像生成模型直接在图中回答空间问题,并将视觉答案还原为原 benchmark 可以评分的结构化预测。
本期播客,No Priors 请来了一位在 AI 推理领域被业内称为「教父级」人物的研究者Noam Brown。他是 OpenAI 的研究科学家,也是推动「test-time compute scaling」成为行业主流方向的关键人物之一。从扑克 AI 到前沿大模型的评估方法论,Brown 的研究轨迹几乎与整个行业对「推理」认知的升级同步。
你可能已经在各种 benchmark 榜单上看过 GUI Agent 的 "大胜" 了。
对 AI Coding 来说,有人用,比任何 Benchmark 都管用,而有人持续付费,又比有人用更管用。
7月2日,字节 Seed 发布了一个 Agent评测项目 EdgeBench。看起来又是一个 benchmark,但它问了一个其他榜单不问的问题。EdgeBench 的切口就是把盲区里的东西放进评测,解答一个问题:把Agent扔进一个陌生环境,12小时后,你能变强多少?
为了解决这一问题,来自 University of Arizona、Zoom 与 Stony Brook University 的研究团队推出了 VISTA(VIsual Spec-To-App Benchmark), 首个面向 Visual Spec-to-Web-App Coding Agents 的端到端 Benchmark。