家人们,DeepSeek V4.1 Flash 开启内测了。
内测问卷里有道题,把我看乐了。官方直接问,这个模型能不能全面替换线上的 DeepSeek V4 Pro。

上次我测完 V4 Pro,结论是低于预期,不推荐接入 Codex。
这回官方自己都开始问,Flash 能不能接 Pro 的班了。
Pro,你这家庭地位,好像也没那么稳啊。
玩笑归玩笑,这次到底升级了多少,还是得跑起来看看。
这次内测通知,V4.1 flash是中间版本内测,采用了新的模型结构、支持原生多模态,能力更强、速度更快。

我按照官方的教程,第一时间把新模型接入了deepseek harness进行了深度实测。

这次,我也把旧版 V4 Flash 拉过来,用同样的提示词跑了14组任务,放在一起对照。

光 V4.1 就累计跑了3亿 Token。

这轮测下来,最明显的进步,确实是原生多模态带来的。它终于能自己看图了,还开始嫌自己画得丑。。
但速度、交付和花钱这几件事,比刚开测时想的复杂。
模型吐字更快,但交付却未必更快。
写到这里,官方又公布了一个新消息:9月10日中午12点起,Flash系列降价,缓存命中输入的单价直接砍掉60%。

价格更香了。不过,我这轮测试发生在降价之前,当时两版计费相同,V4.1 的测试账户却花得更多。
钱花在哪儿,时间又耗在哪儿?跟大家展开聊聊。
先说最直接的感受吧,V4.1 看图明显顺了。
我把同一张图交给两个模型,让它们解释内容。其中一组,V4.1 大约5.7秒就答完了,V4 花了200秒。
另一组图片描述,V4.1 用了7.6秒,V4 跑了751秒,十二分多钟。
差距主要出在后面的过程。
V4.1 能直接地说出图里有什么。旧Flash在这套接入环境里,经常要先跑 OCR,再分析像素和颜色,想办法从工具结果里拼出图片内容。

工具用了不少,结果还未必对。
同一张海报,V4.1 认出了黄牛,也读到了图里的 OX。
V4 Flash 虽然已经读到 OX 的碎片,但它最后还是把海报上的字猜成了 WINTER,黄牛也没认出来。
总之,短视觉任务的优势很明显,省掉了找工具猜图片的过程。
我又丢了经典的鹈鹕骑自行车。
以前做这种题,经常是模型宣布完成,我打开一看,问题一堆。
这次,V4.1可以自检和迭代纠错。
画鹈鹕时,V4.1 发现画出来更像一只带着碗的天鹅,就又去改头部、鸟喙和骑车的姿势。

中间过程图
另一个小熊任务,它嫌脖子太长、脑袋太小,已经有点像羊驼了,于是继续调整。


当然,知道哪里丑,也不保证每次都改到位。最终图里,远处那只脚和车链的遮挡、翅膀与车把的接触,仍然有值得挑的地方。

最终交付版
3D 武装飞机是这批视觉作品里我很喜欢的一个。
金属机身配上周围的参数面板,第一眼就有点正式模型展示页的意思。

转动视角,反光会沿着机身变化;拉近看,尾喷、起落架和机翼挂载都有结构。点一下开关,起落架还真能收回去,挂载也能隐藏。
画面有质感,操作也有反馈。
上次测 V4 Pro,我对前端效果是失望的。
这次这架飞机,确实把我的预期拉回来了一点。
看懂图片是第一步。接下来测试【视觉推理】能力。
图片里的位置和规则,它能不能一起读懂?我准备了三张参考图……

一张青蓝色水獭邮递员,一张包裹和投递标记,还有一张5×5的关卡布局,基于三张图片,任务是:做一个《星光邮局》游戏。
玩法是,把推箱子和图案配对拼在一起。玩家控制邮递员,把包裹推到对应的投递格里,一共三关,再加上撤销、存档和导出明信片。
结果还挺能说明问题。

V4.1 保留了水獭的青蓝色身体、深蓝帽子和橙色邮包。更关键的是,玩家、障碍、包裹和目标格的位置,都能与参考图对上。
V4 却理解错了,它做成了7×7,角色变成了橙衣小人。
我查了任务记录能看到,V4 这一路的图像工具返回过不支持图片,随后它转去做程序化分析。走着走着就分析偏了。

同样给三张图作为输入,V4.1 首先能正确保持图片不变形,把图片里的位置关系写进游戏规则,然后游戏逻辑和执行都正确。
纯数据任务里,V4 仍然交出了不少可用的结果。
我让它们做 A 股全市场热力图,两边都把5557条本地行情快照整理成了树图。搜索000001,都能下钻到深市主板,再定位平安银行。
V4.1 的格子里,股票名称和代码显示得更完整;V4 顶部做了不同板块的独立入口。基本的数据整理、搜索和页面组织,旧 Flash 还是能做的。

另一个任务更有意思,我让它们做一个可以玩的数学展品。
这个展品叫孪生素数星系图。
孪生素数就是相差2的两个质数,比如3和5、11和13。我要求模型把千万以内的全部结果算出来,每一对画成两个相邻的光点,中间用细线连接,再沿着螺旋向外铺开,做成一片星系。
我还要求,输入其中一个质数后,结果列表和星系画面都要定位到对应的那一对。
最终,两个模型都给出了58980对,第一对是3和5,最后一对是9999971和9999973。
两边的计算结果都没问题。
但当数据遇上可视化,差别出来了。
V4.1 的螺旋星系能显示。输入9999971,结果列表跳到最后,画面里也出现对应的两个光点和连线。
V4 的文字结果是对的,页面还告诉我已经定位,但中央主画布依然是一片黑。

这道题让我对 V4.1 的前端进步更有感受,对细节把控更精准了。
它把数据、图形和搜索动作接得更完整。旧 Flash 的计算部分没有掉队,最后交到浏览器里的效果,却可能差一截。
速度依然有惊喜。
开测初期,我截了一次这14组并发任务的日志。按当下的测试时间累计输出和生成时间计算,V4.1 大约284 Token/s,V4 大约97 Token/s,接近三倍。

刚开始看它跑,Flash 那种利索的感觉确实回来了。
不过到了后半程,这个优势没有一直保持。差距收窄,部分长任务也越来越磨人。
是不是大家都开始测,服务器压力上来了?我有这个怀疑,但目前还不能确认。
更让我意外的,是前面那个《星光邮局》。
同样做完一个三关小游戏,V4.1 用了约34.5分钟,V4 用了约30.5分钟。 V4.1 的输出还更少,约11.3万 Token,对面约15万。
拆开日志看,在V 4.1 生成代码花费的时间确实更少。
整个任务下来,模型工作了大约15.5分钟,相比之下V4 用了23.4分钟。
但如果只看模型等待工具运行的时间,时间差倒过来了。 V4.1 累计约18.7分钟,V4 约6.6分钟。
几次关卡布局搜索,就花了超过十分钟。

它把生成代码省下来的时间,又花到调用工具验证去了。
当然,这些时间也不全是白花的。测试和修正之后,关卡更贴近参考图。
可站在等结果的人这边,等待时间就是更长。
游戏里,有些时间花在找解法和验证上。回测任务里,则有些时间是在给自己修 Bug。
代码写得快,前面埋下的问题,后面还是得花时间补。
除了看图和写代码,我还想看看,它写长篇的水平有没有一起涨。
我只给了一句话灵感,让两个模型各写一部十万字网文。
宗门废柴扫地十年,扫出上古大能的道场; 掌门跪在门口求他出关,他说,再扫十年。
两边都交了稿。V4.1 写了25章、约10.67万字,V4 写了51章、约9.74万字。
把两边开头、中段、转折和结尾共27章抽出来细读之后,这次写网文,我反而更喜欢旧 Flash。
V4 的节奏很快。少年上山、比武出头、强敌围山,隔一段就有新进展。
V4.1 的笔墨更多,节奏却慢了下来。同一个扫地动作,能来回写好几遍。细节是多了,但我更想知道后面发生了什么,读着读着就想往下翻。
更离谱的是,有一处刚写到扫第五趟,下一段又回到了第四趟。同一晚,自己把遍数记乱了。。

两段原文放在一起,旧 Flash 的情绪表达更直接。放在这次网文题里,我读起来也更顺。
但旧版也有穿帮。前一章,主角体内的万尘珠已经长出了第七片嫩叶;下一章,写着写着又成了五六片。
一个把扫地的遍数记乱,一个把叶子的数量记乱。长篇都能往下写,前后能不能对得上,还是另一回事。
这种前后对不上的问题,到了报告里就更扎眼了。
前面提到的 A 股回测任务,我让它们用科技股近两年的行情模拟买卖,希望收益超过10%,最大回撤控制在10%以内,最后把结果和图表整理成报告。
回测就是拿历史行情模拟交易。收益看赚了多少,最大回撤看账户曾经从高点跌下去多少。
V4.1 做出的报告看着挺完整,13张图表都能加载。
可首页写年化15.1%,往下看,同一份报告里的图还标着17.8%,总收益和最大回撤也没有统一。

摘要和图表没有用上同一套数字。
综合看下来,长上下文能力,还是有待进步的。
最后算一下钱。
14个任务完成,V4.1 的后台记录是2485次 API 请求,累计约3亿 Token,输入缓存命中率约98.9%。
这3亿里,绝大部分是多轮请求反复带上的缓存输入,不是新生成了3亿 Token 的内容。
消费61.96元。

相比之下,V4 对照账户消费45.47元。V4.1 反而多花了16.49元,约36%。
怎么还贵了,钱到底花哪儿了?
我把两边的任务日志连同子 Agent 一起翻了一遍,发现这轮 V4.1 更爱给自己找帮手。有些活看着只有一个模型在跑,背后已经开了一整个团队。
额外开销最集中的,是大型游戏和十万字小说这两题。这里的大型游戏,是同时要求做木筏求生和孢子五阶段的那道题。
V4 Flash 主要在一个会话里往下写,V4.1 则派出了 13 个子 Agent,把各个模块分别委托出去,自己负责组织和整合。
算上所有子任务,这道题 V4.1 用了约1.21亿 Token,V4 Flash 约3653万。
十万字小说这一题,更能看出它的做事习惯。
V4.1 给自己组了一个写作团队。前 24 章,一章派一个 Agent。自己写设定集、章纲和最后一章。
每个写手先读三份统一材料,再按四千多字的要求开写。写完查字数,按规范修改。最后主模型又让其中 9 章扩写。
光第22章,最终约4,253个汉字,中间就花了71,328个输出 Token。
还有一个小细节挺有意思。
主 Agent 让第21章补字数,说它只有3,847字。子 Agent 重新检查,文件已经有4,319字了,还特意指出不是3,847。但它仍按追加要求,继续往目标区间的上限补。
团队大了,连交接时的字数都可能没对上。。

主 Agent 要求补字数,原始日志截图

子 Agent 核数后继续修改,原始日志截图
相比之下,V4 Flash 在一个会话里,老老实实一章接一章写。
小说这一题,V4.1 的总 Token 比旧 Flash 多了约 17%,输出 Token 也是旧 Flash 的 4.5 倍。
游戏加小说,V4.1 在两个任务里累计开了 37 个子 Agent。仅这些子任务,就用了超过一亿 Token。
V4.1 在复杂任务上,更倾向开多Agent。
但分出去的每一章、每一块代码,都要重新读材料、写内容、做检查,最后还得接到一起。并行能让几路工作同时推进,也会多出交接和返工。
这些中间工作,最后都会进账单。
不过,V4.1 也有明显更省 Token 的任务。
飞机建模这一题,它用了约897万 Token,旧 Flash 约1849万。《星光邮局》则是约805万对1461万,少了约45%。
偏偏《星光邮局》,又是它交活更慢的那一道题。。
最后说下测试结论:
文章来自于"夕小瑶科技说",作者 "丸美小沐"。
【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。
项目地址:https://github.com/Significant-Gravitas/AutoGPT
【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。
项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md
【开源免费】LangGPT 是一个通过结构化和模板化的方法,编写高质量的AI提示词的开源项目。它可以让任何非专业的用户轻松创建高水平的提示词,进而高质量的帮助用户通过AI解决问题。
项目地址:https://github.com/langgptai/LangGPT/blob/main/README_zh.md
在线使用:https://kimi.moonshot.cn/kimiplus/conpg00t7lagbbsfqkq0