Qwen 4用上DeepSeek的Engram!125B MoE一张4090能跑不用量化
Qwen 4用上DeepSeek的Engram!125B MoE一张4090能跑不用量化Qwen4还没出,架构先开源了。
搜索
Qwen4还没出,架构先开源了。
随着开源模型能力不断提升,它们已经能够以极低的成本生成多个高质量候选方案,并进一步利用模型自身对这些结果进行验证、打分和筛选。斯坦福团队最新实验发现,使用 DeepSeek V4 Flash + LLM-as-a-Verifier 进行「自验证」,可以在 Terminal-Bench 2.1 上超越 Claude Fable 5,同时整体成本低约 11 倍。
8月14日,一个叫Cocode的项目悄悄出现在GitHub上,简介写得很直白,基于DeepSeek Harness构建的开箱即用发行版。不到两周,它拿到150多个star,并在8月25日发布了v1.0.2。
最近 DeepSeek Harness(DSH)真是太火了!之前我发过 《首发实测 + 入门教程》 教大家如何安装使用,还盘点过 《16 个超火的 DSH 插件》。
凌晨2点,一个B站直播里还有两百多人,同时在看一个人反复让DeepSeek跑任务。屏幕上没什么特别的。一个终端,一个Agent,一段不断往下刷的思维链。弹幕却一直没停。
刚刚,外媒The Information援引知情人士报道,DeepSeek今年前7个月营收约4.75亿元,约为其2025年全年营收的10倍;净亏损约7.15亿元,2025年全年净亏损为9.35亿元。
DeepSeek Harness(DSH) 的口号,大家应该都有所了解,模型、工具、Skills、会话、沙箱、存储、Agent Loop、调度,甚至 UI,一切皆插件。
“你以为你买的是 DeepSeek Flash,实际上可能是个 1.5 bit 的 DeepSeek,或者里面掺了 Opus 用于训练。”这是 Pi 核心贡献者 Armin Ronacher 的一个比喻。他形容现在的 token 市场像一种成分不明的商品——量化程度、实际版本、是否掺了别的东西、计费方式,全是黑洞。
就在刚刚,英伟达史上首次公布了下一代旗舰级机柜 Vera Rubin NVL72 的首次片上实测数据。而且,这次实测直接拉来了DeepSeek-V4-Pro,跑最真实的「智能体编码」任务!结果令人吃惊:对比当前的主力机皇GB300 NVL72,Vera Rubin的每兆瓦吞吐量最高飙升了30倍、Token成本最高暴降了35倍!
同样的模型,同样的任务,让它执行五遍,再让他自己挑一遍最稳的,效果能有多大提升?斯坦福把这套玩法用在了AI身上,DeepSeek V4 Flash在Terminal-Bench 2.1的成绩从79%一路涨到88%,反超了尖子生Fable 5。而且连做五遍加挑选这一通折腾,价格依然比Fable 5便宜了4-11倍。