豆包这次把牙膏挤爆了!实测Seed-2.1-pro最新版

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
豆包这次把牙膏挤爆了!实测Seed-2.1-pro最新版
6492点击    2026-09-17 10:51

大家好,我是莫理。 


盼了三个月,今天 Seed-2.1-pro 终于迭代了 


豆包这次把牙膏挤爆了!实测Seed-2.1-pro最新版


今年6月,字节Seed正式发布Doubao-Seed-2.1系列,主打生产力场景,重点提升通用Agent、代码工程交付和多模态理解。


还有一条持续迭代的Evolving路线,可以把它理解为一个固定代号,顶尖的模型都会在这里滚动更新。


豆包这次把牙膏挤爆了!实测Seed-2.1-pro最新版


其中经过迭代和验证的能力,会逐步沉淀到稳定版本里。比如今天的主角Seed-2.1-pro 0915版,可以看作是Agent、Coding和多模态最新能力的一次集中落地。


等了三个月,这次更新到底值不值得等?接下来,咱们直接上实测 


实测一:从0完成项目MVP


OPC和小公司是Agent很适合的一种场景。


从开始想做个东西,到市场调研、竞品、用户需求、产品定义、交互设计、开发、测试和运营,一个人就能身兼数职,面面俱到。


所以第一组,我用到了字节自家的豆包工作Agent,我特意把要求写的很模糊:做一个将来真正能落地、面向普通用户的小型产品调研并实现MVP。


豆包这次把牙膏挤爆了!实测Seed-2.1-pro最新版


接到任务以后,它先做了一次任务拆解,然后以一个总负责人的身份,并行开启了两个子智能体,一个做需求调研,一个做竞品深度对比调研,同时还启用了浏览器测试能力。


豆包这次把牙膏挤爆了!实测Seed-2.1-pro最新版


完全自主决定。


比较有意思的是,两个子 Agent 最后给出了两份调研报告,而且结论并不完全一致。如果模型只想赶紧交差,其实随便挑一个方向就可以继续往下跑。


但它没有这么干。它把两份报告重新放在一起,从需求强度、竞品情况、产品可行性等角度又做了一轮综合判断,然后才把最终向定下来。


豆包这次把牙膏挤爆了!实测Seed-2.1-pro最新版


方向确定以后,产品定义、视觉规范、功能规划和开发继续往下跑。


豆包这次把牙膏挤爆了!实测Seed-2.1-pro最新版


整个任务从发出去到全部交付,前后运行了一个多小时,期间拉起了十多个子 Agent。我主动介入0次。


最后拿到的是14份文档与代码文件,以及19张浏览器实测截图。


豆包这次把牙膏挤爆了!实测Seed-2.1-pro最新版


当然,最终交付的依然是一版MVP原型。我也没有特别追求这个产品今天就能拿出去创业。


这组Case真正看的,是前面那条很长的链路,调研、判断规划、执行、测试、交付。


当Agent的长任务能力继续提升以后,整个过程开始越来越像一个有组织结构的小团队:负责人拆任务,不同角色并行工作,最后重新汇总、判断,再继续推进。


实测二:修改大型开源项目


这一轮我换个玩法,把它接入 Claude Code,干一件更偏工程、更偏真实代码项目的大业务。


我选的是Excalidraw,开源手绘风白板的天花板级项目,GitHub 上非常火,很多人每天都在用。


TypeScript 代码大约有20多万行,其中生产代码 14 万行、测试代码 6.1 万行。光是核心的 App.tsx 一个文件,就有 14,297 行。


豆包这次把牙膏挤爆了!实测Seed-2.1-pro最新版


我给它的任务分三步走,也就是一个工程师接手陌生项目的完整链路:审查代码、修复问题、新增功能


① 代码审查


第一轮我明确要求只读不改,做Code Review


它一口气派出了 4 个 Agent 并行开工,专门来找真实可修复的bug。


豆包这次把牙膏挤爆了!实测Seed-2.1-pro最新版


作为一款老牌成熟开源项目,基本功能层面确实几乎找不到毛病,但Seed-2.1-pro居然从20万行里挖出了19个可修复问题,其中8个中危以上,集中在边界归一化和异步竞态上。


豆包这次把牙膏挤爆了!实测Seed-2.1-pro最新版


② 项目修复


既然找出了问题,下一步就是修复。


豆包这次把牙膏挤爆了!实测Seed-2.1-pro最新版


我让它根据前面的 Code Review 自己制定修复方案,再继续往下执行。


豆包这次把牙膏挤爆了!实测Seed-2.1-pro最新版


最终 8 项修改全部完成验证。tsc 类型检查零错误,相关的 800 多项测试全部通过。


豆包这次把牙膏挤爆了!实测Seed-2.1-pro最新版


③ 新增功能


修 bug 只是维护,在它原本的架构上做二次开发,加点新功能才更有意思。


我先后提了两批需求。


第一批,是 Frame 的批量操作。


Excalidraw 的Frame可以一页一页当 PPT 用,但原版很多操作需要手动处理。我让模型补齐批量创建等能力,最后落地了四个相关功能和命令。


豆包这次把牙膏挤爆了!实测Seed-2.1-pro最新版


开发过程中它会自行拉起子 Agent 分工处理。


豆包这次把牙膏挤爆了!实测Seed-2.1-pro最新版


成果演示:


可以批量创建 Frame,选择数量、比例和编号规则。


豆包这次把牙膏挤爆了!实测Seed-2.1-pro最新版


选中多个 Frame 以后,右键还可以直接批量重命名。


豆包这次把牙膏挤爆了!实测Seed-2.1-pro最新版


整个功能的交互、UI、配色基本沿着 Excalidraw 原来的产品语言继续做,几乎可以算是融为一体。


第二批需求则更直观,新增图形。


原版常用的基础图形主要是矩形、菱形、椭圆等,确实不够用,我希望再补一些常用形状。


豆包这次把牙膏挤爆了!实测Seed-2.1-pro最新版


于是让Seed-2.1-pro新增 6 种基础图形。


豆包这次把牙膏挤爆了!实测Seed-2.1-pro最新版


中间也没有一路顺风。


第一版虽然已经能正常画出来,但形状边缘太标准,少了 Excalidraw 原本那种弯弯曲曲的手绘感。


我把这个问题指出来以后,它继续向下查原因,定位到源文件里的相关实现,再修改、运行、验证。


豆包这次把牙膏挤爆了!实测Seed-2.1-pro最新版


最终第二批功能完整融入了项目 👇


豆包这次把牙膏挤爆了!实测Seed-2.1-pro最新版


整套审查、修复、新增功能的流程走下来,新增了大约2000多行代码,没有新增依赖,也没有改动原有的协议。


最后跑全量回归,100 多个测试文件、2000 多个用例全部通过。


豆包这次把牙膏挤爆了!实测Seed-2.1-pro最新版


整个过程跑下来,我越来越觉得AI时代,做一个Demo越来越快,但Demo本身也越来越重复。


很多人做产品时,第一反应是让AI从一个空文件夹开始造轮子。其实大量需求,开源世界里早就有非常成熟的地基了。


找到一个足够好的开源项目,让 AI 去读懂它、尊重它原来的架构,在这个基础上改造成真正符合自己需求的工具,我觉得这才是 Coding Agent 越来越有意思的地方。


实测三:多模态能力


测完通用 Agent 和 Coding,接下来我想单独看看 Seed-2.1-pro 的多模态。


官方在 Seed2.1 发布时,就把复杂视觉信息和视频理解列为基础能力的重要一环。


所以这一轮,我没有停在这张图里有什么这种简单的图像识别。


① 视觉规律推理


第一关,我直接拿了几道公考图推题。


看过这类题的人应该都懂,有时候明明只有几块黑白图形,盯两分钟以后还是会开始怀疑人生。


但正因为这样,它特别适合拿来测AI。因为这一道题里,同时考了两件事,多模态识别和逻辑推理。


于是我找了最新的4道题目。


豆包这次把牙膏挤爆了!实测Seed-2.1-pro最新版


提示词我没给太具体的要求,连带图片直接发给agent,来分析。


豆包这次把牙膏挤爆了!实测Seed-2.1-pro最新版


先说结果吧,4 道题,全对。


当我看到答案的时候,我是真觉得离谱。。。


本来我做好了它错一两个的准备,甚至想好了它要是一本正经地胡说八道,我该怎么吐槽,结果一个都没给我机会。


豆包这次把牙膏挤爆了!实测Seed-2.1-pro最新版


而且整个过程,联网搜索是关掉的。没有题库可以搜,没有解析可以抄,只能看着图片自己推理。


豆包这次把牙膏挤爆了!实测Seed-2.1-pro最新版


让我意外的第一件事,是它对待模糊图片的处理方式。


题目图片只是 640×480 的翻拍照片,格子里的黑块、多边形的边都不算清晰。它没有硬看,而是自己写了一段代码,把题干和选项放大 3~5 倍,然后一格一格看位置、一条一条数边,再开始推规律。


豆包这次把牙膏挤爆了!实测Seed-2.1-pro最新版


回头看它的推理过程,封闭区域数量、对称关系这些判断也确实对应公考图推里常见的考察方式。


豆包这次把牙膏挤爆了!实测Seed-2.1-pro最新版


不过这里也不能因为 4 道题全对,就直接宣布它已经横扫公考图推。


样本还是太少,但这一轮至少让我明白AI会识图这件事,现在已经没那么值得惊讶了。


真正的分水岭是看见、看懂、推理、判断。一张图丢过去,它能自己在像素里找到一条藏起来的规律,还能说清楚为什么是这条、不是那条,这样才算没白看。


② UI复刻


第二个测试,我没有继续做静态 UI。


因为静态网页截图复刻,现在很多模型都已经能做得有模有样。这次我找的是 OpenAI 官网里一个我一直挺喜欢的动态展示效果。


豆包这次把牙膏挤爆了!实测Seed-2.1-pro最新版


对于多模态模型来说,看一帧只能看到现在长什么样。但如果输入是一段录屏,它还需要搞清楚前后发生了什么,以及变化规则是什么。


Seed-2.1-pro 所属的 Seed2.1 系列本身就强调了对视频等复杂视觉内容的理解能力。


我把录屏直接交给豆包办公模式。模型先找到视频文件,调用视频处理Skill抽帧,把不同时间点的画面拆出来分析。


豆包这次把牙膏挤爆了!实测Seed-2.1-pro最新版


成功get到发布页的核心交互特点,鼠标扫过字母时,贴纸会带着物理效果飞入吸附,鼠标离开后消失。


豆包这次把牙膏挤爆了!实测Seed-2.1-pro最新版


前期的分析工作完成后,它给标题里的每一个字符都设计了一个独立材质的贴纸造型,调用内置生图模型逐张生成,再自动抠图、羽化、裁边、处理成透明底。


豆包这次把牙膏挤爆了!实测Seed-2.1-pro最新版


一共做了 24 张素材,部分重点字符还准备了第二套样式。


豆包这次把牙膏挤爆了!实测Seed-2.1-pro最新版


最后继续写代码,把整个效果做成一个可以实际交互的 Web 页面。最终每张贴纸都有自己的弹性字符槽,弹入的一瞬间槽位张开,两侧字母会随之移动。


豆包这次把牙膏挤爆了!实测Seed-2.1-pro最新版


整个过程里还有一件事让我省了很多步骤。


它是在豆包办公模式内置的浏览器里直接跑验证的。每改一版,它自己打开页面、模拟鼠标慢扫、回扫、停留,再截图发回给自己分析,发现问题继续改,不需要我自己录屏、描述问题、再把截图喂回去。


豆包这次把牙膏挤爆了!实测Seed-2.1-pro最新版


所以这轮我最大的感受是,静态 UI 复刻已经越来越难代表一个模型视觉能力的上限。


当输入变成视频以后,它面对的是时间关系、交互规则和变化逻辑。


看完以后还能继续生成素材、写代码、自己验证和返工,多模态才真正开始和 Agent、Coding 串起来。


实测四:数据处理分析


接下来这个场景,我觉得也很适合小团队。


很多时候大家并不缺业务数据,搞电商、搞运营、做账号,每天都能积累大量EXCEL,麻烦的是这些表到底说明了什么?


如果没有专门的数据分析团队,大量数据以及藏在里面的问题最后很容易躺在文件夹里吃灰。


所以这一轮,我搞了了个EXCEL随机数据生成工具,模拟出一套电商经营数据,包含5张表、250 个客户、80 个 SKU、1000笔订单。


豆包这次把牙膏挤爆了!实测Seed-2.1-pro最新版


拿到文件以后,Seed-2.1-pro 没有直接开始写总结。


它先用代码完整读取五个文件,然后干了一件数据分析之前非常重要的事:


检查数据质量。


豆包这次把牙膏挤爆了!实测Seed-2.1-pro最新版


确认数据以后,它自己建立了一套分析框架。


整个过程中前后写了 10 个编号脚本,用来做数据读取、清洗、指标计算、关联分析和最终展示。


豆包这次把牙膏挤爆了!实测Seed-2.1-pro最新版


最后交出来的是一个可交互 HTML 仪表盘。


里面有 20 多张图表,覆盖:业务趋势、订单流转、下单渠道、获客渠道、客户复购、品类利润率、售后和退款等维度,所有内容可视化呈现,非常直观。


豆包这次把牙膏挤爆了!实测Seed-2.1-pro最新版


它自己用无头浏览器截图检查的时候,在图表这里遇到过一些小问题,


豆包这次把牙膏挤爆了!实测Seed-2.1-pro最新版


发现CDN资源在本地加载失败、ECharts图全是空白,就主动修复把图表库下载到本地重引。


豆包这次把牙膏挤爆了!实测Seed-2.1-pro最新版


等所有结果都跑完以后,它再按照优先级整理出下一步行动建议。


豆包这次把牙膏挤爆了!实测Seed-2.1-pro最新版


任务全程,我只发了开头那一条指令,中途没有提示过任何指标、路径或结论。


它自己读表、自己写代码跑数、自己发现算错、自己返工验证、自己截图检查网页,最后交付了清洗数据、脚本、仪表盘和行动建议。


而且,比起干巴巴枯燥的数据,可视化的效果更方便、更直观。


实测五:AI辅助内容分析


对于内容创作者来说,长期写下去以后会积累越来越多文章、图片和数据。但我们每天想着下一篇写什么,很容易只顾往前闷头写,很少系统回头看看。


所以莫理把过去写过的50篇文章全部导成 Markdown,把正文、标题以及对应的图片一起交给Seed-2.1-pro。看看能得到什么样的分析。


豆包这次把牙膏挤爆了!实测Seed-2.1-pro最新版


在没有给具体 UI 要求的情况下,Seed-2.1-pro主动参考了已有内容里的 IP 配色和视觉元素,把最终分析网页也做成了相近的风格。


豆包这次把牙膏挤爆了!实测Seed-2.1-pro最新版


无论是色彩搭配、网页结构,就像在看自己的文章,我也第一次这么直观地看清了自己账号的近期数据。


50 篇文章,跨度 70 天,50 份 Markdown 正文,10.4 万个汉字;素材图1000多张。


豆包这次把牙膏挤爆了!实测Seed-2.1-pro最新版


文章的数据被清晰地分类和呈现,可以看出数据基本稳定,偶尔还能踩中热点,出个爆款。


豆包这次把牙膏挤爆了!实测Seed-2.1-pro最新版


作为一名内容创作者,有时我只顾往前走、一直写,却忘记了复盘、分析与总结。Seed-2.1-pro 模型看到了很多我不曾关心和注意的内容,比如文章的篇数构成和阅读贡献。


豆包这次把牙膏挤爆了!实测Seed-2.1-pro最新版


甚至主动搞了非常形象和有用的传播现象图,一个轴是价值密度,一个轴是流量表现,把过去不同类型的内容放进去。


豆包这次把牙膏挤爆了!实测Seed-2.1-pro最新版


最后给出了下一阶段的内容策略,让我把最拿手的"同一套提示词横向评测"固定成一个常驻栏目、可以继续更新Agent和价格战这两条已经验证过的路径。


豆包这次把牙膏挤爆了!实测Seed-2.1-pro最新版


还替我设计了一些固定栏目。


豆包这次把牙膏挤爆了!实测Seed-2.1-pro最新版


都说当局者迷,旁观者清。


做内容的时候,我每天都在想下一篇。但让 Seed-2.1-pro 从50篇文章的视角重新看回来以后,我确实发现了一些自己过去没有特别注意的东西。


豆包这次把牙膏挤爆了!实测Seed-2.1-pro最新版


而当模型开始能把这些过去的信息重新连接起来,它才能真正成为我们的内容策略助手。


写在最后


这几组 Case 跑完以后,我最明显的感受是Agent、Coding、多模态,正在越来越深地组合到一起。


真实Agent工作里,很少有任务是独立成型的。更多时候,我们拿到的是一堆资料、图片、代码和一个模糊目标,然后想办法把事情做完。


这次 Seed-2.1-pro 给我的感觉也是这样,模型能力大幅提升,放到Agent里跑非常明显。


它已经能顺利在一个长任务里自己主动找到下一步,遇到问题继续执行修复,最后把结果顺利交付。实测能力非常出色!


以上,就是本篇文章的全部内容。目前API已全量上线火山方舟。大家还想看我拿 Seed-2.1-pro 测什么任务呢~


文章来自于"莫理",作者 "小小莫理"。

AI转型,免费服务,就找AITNT
AITNT资源拓展
根据文章内容,系统为您匹配了更有价值的资源信息。内容由AI生成,仅供参考
1
AI代理

【开源免费】Browser-use 是一个用户AI代理直接可以控制浏览器的工具。它能够让AI 自动执行浏览器中的各种任务,如比较价格、添加购物车、回复各种社交媒体等。

项目地址:https://github.com/browser-use/browser-use


2
智能体

【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。

项目地址:https://github.com/Significant-Gravitas/AutoGPT


【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。

项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md

3
prompt

【开源免费】LangGPT 是一个通过结构化和模板化的方法,编写高质量的AI提示词的开源项目。它可以让任何非专业的用户轻松创建高水平的提示词,进而高质量的帮助用户通过AI解决问题。

项目地址:https://github.com/langgptai/LangGPT/blob/main/README_zh.md

在线使用:https://kimi.moonshot.cn/kimiplus/conpg00t7lagbbsfqkq0