DeepSeek V4.1 Flash实测,花3亿token,14组任务,居然比上代贵

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
DeepSeek V4.1 Flash实测,花3亿token,14组任务,居然比上代贵
5359点击    2026-09-09 10:53

家人们,DeepSeek V4.1 Flash 开启内测了。


内测问卷里有道题,把我看乐了。官方直接问,这个模型能不能全面替换线上的 DeepSeek V4 Pro。


DeepSeek V4.1 Flash实测,花3亿token,14组任务,居然比上代贵


上次我测完 V4 Pro,结论是低于预期,不推荐接入 Codex。


这回官方自己都开始问,Flash 能不能接 Pro 的班了。


Pro,你这家庭地位,好像也没那么稳啊。


玩笑归玩笑,这次到底升级了多少,还是得跑起来看看。


这次内测通知,V4.1 flash是中间版本内测,采用了新的模型结构、支持原生多模态,能力更强、速度更快。


DeepSeek V4.1 Flash实测,花3亿token,14组任务,居然比上代贵


我按照官方的教程,第一时间把新模型接入了deepseek harness进行了深度实测。


DeepSeek V4.1 Flash实测,花3亿token,14组任务,居然比上代贵


这次,我也把旧版 V4 Flash 拉过来,用同样的提示词跑了14组任务,放在一起对照。


DeepSeek V4.1 Flash实测,花3亿token,14组任务,居然比上代贵


光 V4.1 就累计跑了3亿 Token


DeepSeek V4.1 Flash实测,花3亿token,14组任务,居然比上代贵


这轮测下来,最明显的进步,确实是原生多模态带来的。它终于能自己看图了,还开始嫌自己画得丑。。


但速度、交付和花钱这几件事,比刚开测时想的复杂。


模型吐字更快,但交付却未必更快。


写到这里,官方又公布了一个新消息:9月10日中午12点起,Flash系列降价,缓存命中输入的单价直接砍掉60%。


DeepSeek V4.1 Flash实测,花3亿token,14组任务,居然比上代贵


价格更香了。不过,我这轮测试发生在降价之前,当时两版计费相同,V4.1 的测试账户却花得更多。


钱花在哪儿,时间又耗在哪儿?跟大家展开聊聊。


一、原生多模态,少绕很多弯路


先说最直接的感受吧,V4.1 看图明显顺了。


我把同一张图交给两个模型,让它们解释内容。其中一组,V4.1 大约5.7秒就答完了,V4 花了200秒。


另一组图片描述,V4.1 用了7.6秒,V4 跑了751秒,十二分多钟。


差距主要出在后面的过程。


V4.1 能直接地说出图里有什么。旧Flash在这套接入环境里,经常要先跑 OCR,再分析像素和颜色,想办法从工具结果里拼出图片内容。


DeepSeek V4.1 Flash实测,花3亿token,14组任务,居然比上代贵


工具用了不少,结果还未必对。


同一张海报,V4.1 认出了黄牛,也读到了图里的 OX。


V4 Flash 虽然已经读到 OX 的碎片,但它最后还是把海报上的字猜成了 WINTER,黄牛也没认出来。


总之,短视觉任务的优势很明显,省掉了找工具猜图片的过程。


我又丢了经典的鹈鹕骑自行车。


以前做这种题,经常是模型宣布完成,我打开一看,问题一堆。


这次,V4.1可以自检和迭代纠错。


画鹈鹕时,V4.1 发现画出来更像一只带着碗的天鹅,就又去改头部、鸟喙和骑车的姿势。


DeepSeek V4.1 Flash实测,花3亿token,14组任务,居然比上代贵

中间过程图


另一个小熊任务,它嫌脖子太长、脑袋太小,已经有点像羊驼了,于是继续调整。


DeepSeek V4.1 Flash实测,花3亿token,14组任务,居然比上代贵


DeepSeek V4.1 Flash实测,花3亿token,14组任务,居然比上代贵


当然,知道哪里丑,也不保证每次都改到位。最终图里,远处那只脚和车链的遮挡、翅膀与车把的接触,仍然有值得挑的地方。


DeepSeek V4.1 Flash实测,花3亿token,14组任务,居然比上代贵

最终交付版


3D 武装飞机是这批视觉作品里我很喜欢的一个。


金属机身配上周围的参数面板,第一眼就有点正式模型展示页的意思。


DeepSeek V4.1 Flash实测,花3亿token,14组任务,居然比上代贵


转动视角,反光会沿着机身变化;拉近看,尾喷、起落架和机翼挂载都有结构。点一下开关,起落架还真能收回去,挂载也能隐藏。


画面有质感,操作也有反馈。


上次测 V4 Pro,我对前端效果是失望的。


这次这架飞机,确实把我的预期拉回来了一点。


二、它能把图片里的信息,变成游戏里的数据


看懂图片是第一步。接下来测试【视觉推理】能力。


图片里的位置和规则,它能不能一起读懂?我准备了三张参考图……


DeepSeek V4.1 Flash实测,花3亿token,14组任务,居然比上代贵


一张青蓝色水獭邮递员,一张包裹和投递标记,还有一张5×5的关卡布局,基于三张图片,任务是:做一个《星光邮局》游戏。


玩法是,把推箱子和图案配对拼在一起。玩家控制邮递员,把包裹推到对应的投递格里,一共三关,再加上撤销、存档和导出明信片。


结果还挺能说明问题。


DeepSeek V4.1 Flash实测,花3亿token,14组任务,居然比上代贵


V4.1 保留了水獭的青蓝色身体、深蓝帽子和橙色邮包。更关键的是,玩家、障碍、包裹和目标格的位置,都能与参考图对上。


V4 却理解错了,它做成了7×7,角色变成了橙衣小人。


我查了任务记录能看到,V4 这一路的图像工具返回过不支持图片,随后它转去做程序化分析。走着走着就分析偏了。


DeepSeek V4.1 Flash实测,花3亿token,14组任务,居然比上代贵


同样给三张图作为输入,V4.1 首先能正确保持图片不变形,把图片里的位置关系写进游戏规则,然后游戏逻辑和执行都正确。


三、数据处理能力依据很强,前端进步明显


纯数据任务里,V4 仍然交出了不少可用的结果。


我让它们做 A 股全市场热力图,两边都把5557条本地行情快照整理成了树图。搜索000001,都能下钻到深市主板,再定位平安银行。


V4.1 的格子里,股票名称和代码显示得更完整;V4 顶部做了不同板块的独立入口。基本的数据整理、搜索和页面组织,旧 Flash 还是能做的。


DeepSeek V4.1 Flash实测,花3亿token,14组任务,居然比上代贵


另一个任务更有意思,我让它们做一个可以玩的数学展品。


这个展品叫孪生素数星系图。


孪生素数就是相差2的两个质数,比如3和5、11和13。我要求模型把千万以内的全部结果算出来,每一对画成两个相邻的光点,中间用细线连接,再沿着螺旋向外铺开,做成一片星系。


我还要求,输入其中一个质数后,结果列表和星系画面都要定位到对应的那一对。


最终,两个模型都给出了58980对,第一对是3和5,最后一对是9999971和9999973。


两边的计算结果都没问题。


但当数据遇上可视化,差别出来了。


V4.1 的螺旋星系能显示。输入9999971,结果列表跳到最后,画面里也出现对应的两个光点和连线。


V4 的文字结果是对的,页面还告诉我已经定位,但中央主画布依然是一片黑。


DeepSeek V4.1 Flash实测,花3亿token,14组任务,居然比上代贵


这道题让我对 V4.1 的前端进步更有感受,对细节把控更精准了。


它把数据、图形和搜索动作接得更完整。旧 Flash 的计算部分没有掉队,最后交到浏览器里的效果,却可能差一截。


四、吐字快,交活未必快


速度依然有惊喜。


开测初期,我截了一次这14组并发任务的日志。按当下的测试时间累计输出和生成时间计算,V4.1 大约284 Token/s,V4 大约97 Token/s,接近三倍。


DeepSeek V4.1 Flash实测,花3亿token,14组任务,居然比上代贵


刚开始看它跑,Flash 那种利索的感觉确实回来了。


不过到了后半程,这个优势没有一直保持。差距收窄,部分长任务也越来越磨人。


是不是大家都开始测,服务器压力上来了?我有这个怀疑,但目前还不能确认。


更让我意外的,是前面那个《星光邮局》。


同样做完一个三关小游戏,V4.1 用了约34.5分钟,V4 用了约30.5分钟。 V4.1 的输出还更少,约11.3万 Token,对面约15万。


拆开日志看,在V 4.1 生成代码花费的时间确实更少。


整个任务下来,模型工作了大约15.5分钟,相比之下V4 用了23.4分钟。


但如果只看模型等待工具运行的时间,时间差倒过来了。 V4.1 累计约18.7分钟,V4 约6.6分钟。


几次关卡布局搜索,就花了超过十分钟。


DeepSeek V4.1 Flash实测,花3亿token,14组任务,居然比上代贵


它把生成代码省下来的时间,又花到调用工具验证去了。


当然,这些时间也不全是白花的。测试和修正之后,关卡更贴近参考图。


可站在等结果的人这边,等待时间就是更长。


游戏里,有些时间花在找解法和验证上。回测任务里,则有些时间是在给自己修 Bug。


代码写得快,前面埋下的问题,后面还是得花时间补。


五、长上下文能力有待提升


除了看图和写代码,我还想看看,它写长篇的水平有没有一起涨。


我只给了一句话灵感,让两个模型各写一部十万字网文。


宗门废柴扫地十年,扫出上古大能的道场; 掌门跪在门口求他出关,他说,再扫十年。


两边都交了稿。V4.1 写了25章、约10.67万字,V4 写了51章、约9.74万字。


把两边开头、中段、转折和结尾共27章抽出来细读之后,这次写网文,我反而更喜欢旧 Flash。


V4 的节奏很快。少年上山、比武出头、强敌围山,隔一段就有新进展。


V4.1 的笔墨更多,节奏却慢了下来。同一个扫地动作,能来回写好几遍。细节是多了,但我更想知道后面发生了什么,读着读着就想往下翻。


更离谱的是,有一处刚写到扫第五趟,下一段又回到了第四趟。同一晚,自己把遍数记乱了。。


DeepSeek V4.1 Flash实测,花3亿token,14组任务,居然比上代贵


两段原文放在一起,旧 Flash 的情绪表达更直接。放在这次网文题里,我读起来也更顺。


但旧版也有穿帮。前一章,主角体内的万尘珠已经长出了第七片嫩叶;下一章,写着写着又成了五六片。


一个把扫地的遍数记乱,一个把叶子的数量记乱。长篇都能往下写,前后能不能对得上,还是另一回事。


这种前后对不上的问题,到了报告里就更扎眼了。


前面提到的 A 股回测任务,我让它们用科技股近两年的行情模拟买卖,希望收益超过10%,最大回撤控制在10%以内,最后把结果和图表整理成报告。


回测就是拿历史行情模拟交易。收益看赚了多少,最大回撤看账户曾经从高点跌下去多少。


V4.1 做出的报告看着挺完整,13张图表都能加载。


可首页写年化15.1%,往下看,同一份报告里的图还标着17.8%,总收益和最大回撤也没有统一。


DeepSeek V4.1 Flash实测,花3亿token,14组任务,居然比上代贵


摘要和图表没有用上同一套数字。


综合看下来,长上下文能力,还是有待进步的。


◈六、V4.1的总花费反而更多


最后算一下钱。


14个任务完成,V4.1 的后台记录是2485次 API 请求,累计约3亿 Token,输入缓存命中率约98.9%。


这3亿里,绝大部分是多轮请求反复带上的缓存输入,不是新生成了3亿 Token 的内容。


消费61.96元。


DeepSeek V4.1 Flash实测,花3亿token,14组任务,居然比上代贵


相比之下,V4 对照账户消费45.47元。V4.1 反而多花了16.49元,约36%。


怎么还贵了,钱到底花哪儿了?


我把两边的任务日志连同子 Agent 一起翻了一遍,发现这轮 V4.1 更爱给自己找帮手。有些活看着只有一个模型在跑,背后已经开了一整个团队。


额外开销最集中的,是大型游戏和十万字小说这两题。这里的大型游戏,是同时要求做木筏求生和孢子五阶段的那道题。


V4 Flash 主要在一个会话里往下写,V4.1 则派出了 13 个子 Agent,把各个模块分别委托出去,自己负责组织和整合。


算上所有子任务,这道题 V4.1 用了约1.21亿 Token,V4 Flash 约3653万。


十万字小说这一题,更能看出它的做事习惯。


V4.1 给自己组了一个写作团队。前 24 章,一章派一个 Agent。自己写设定集、章纲和最后一章。


每个写手先读三份统一材料,再按四千多字的要求开写。写完查字数,按规范修改。最后主模型又让其中 9 章扩写。


光第22章,最终约4,253个汉字,中间就花了71,328个输出 Token。


还有一个小细节挺有意思。


主 Agent 让第21章补字数,说它只有3,847字。子 Agent 重新检查,文件已经有4,319字了,还特意指出不是3,847。但它仍按追加要求,继续往目标区间的上限补。


团队大了,连交接时的字数都可能没对上。。


DeepSeek V4.1 Flash实测,花3亿token,14组任务,居然比上代贵


主 Agent 要求补字数,原始日志截图


DeepSeek V4.1 Flash实测,花3亿token,14组任务,居然比上代贵


子 Agent 核数后继续修改,原始日志截图


相比之下,V4 Flash 在一个会话里,老老实实一章接一章写。


小说这一题,V4.1 的总 Token 比旧 Flash 多了约 17%,输出 Token 也是旧 Flash 的 4.5 倍


游戏加小说,V4.1 在两个任务里累计开了 37 个子 Agent。仅这些子任务,就用了超过一亿 Token。


V4.1 在复杂任务上,更倾向开多Agent。


但分出去的每一章、每一块代码,都要重新读材料、写内容、做检查,最后还得接到一起。并行能让几路工作同时推进,也会多出交接和返工。


这些中间工作,最后都会进账单。


不过,V4.1 也有明显更省 Token 的任务。


飞机建模这一题,它用了约897万 Token,旧 Flash 约1849万。《星光邮局》则是约805万对1461万,少了约45%。


偏偏《星光邮局》,又是它交活更慢的那一道题。。


最后说下测试结论:


  1. V4.1 视觉理解相比V4 进步明显;
  2. V4.1 复杂任务更容易开多Agent,token消耗多;
  3. 数分和报告工程上,和V4几乎没有区别;
  4. 非视觉端到端任务的完成时间没有明显变化(dsh内);
  5. 长上下文理解能力尚有进步空间;


文章来自于"夕小瑶科技说",作者 "丸美小沐"。

AI转型,免费服务,就找AITNT
AITNT资源拓展
根据文章内容,系统为您匹配了更有价值的资源信息。内容由AI生成,仅供参考
1
智能体

【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。

项目地址:https://github.com/Significant-Gravitas/AutoGPT


【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。

项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md

2
prompt

【开源免费】LangGPT 是一个通过结构化和模板化的方法,编写高质量的AI提示词的开源项目。它可以让任何非专业的用户轻松创建高水平的提示词,进而高质量的帮助用户通过AI解决问题。

项目地址:https://github.com/langgptai/LangGPT/blob/main/README_zh.md

在线使用:https://kimi.moonshot.cn/kimiplus/conpg00t7lagbbsfqkq0