豆包大模型再更新,发力多模态编程,一手实测来了

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
豆包大模型再更新,发力多模态编程,一手实测来了
7339点击    2026-09-18 15:48

国庆、中秋双节快到了,出游的地方想好了吗?


这件事,AI 已经能帮上忙。我们只给了模型一段话,它依靠出色的多模态编程能力,交出了一份可交互的 3D 山西旅行导览。


豆包大模型再更新,发力多模态编程,一手实测来了


提示词:收集整理山西旅游相关知识和信息,绘制一份 3D 山西旅行景点地图/导览,可移动并可交互点击,了解各个景点在哪,主要看点是什么,有什么游玩 tips。画面清晰、好看、有趣。


结果相当惊艳!打开页面,首先是一张汇集山西代表性景点的山水风格首页。进入地图后,模型按照山西的海拔起伏搭出了 3D 地形,配色清爽耐看,整体信息也大致准确,还推荐了 4 条主题旅游路线。


这是字节前两天上线的新版豆包 2.1 Pro(版本号:0915),API 已在火山方舟全量上线,豆包工作同步接入。


官方公布的更新方向有四个:多模态 CodingAgent 专业任务交付面向 3D 与专业图文的多模态理解,以及 Token 效率。其中最受关注的是多模态编程,也就是让模型看着设计稿、图纸、录屏写代码,再根据运行画面继续修改。


过去几天,我们围绕该模型做了一轮集中实测。


跟着小王子


从一幅画开始


正巧,最近有位同事带了本《小王子》来编辑部,所以在这一轮实测中,我们决定跟着小王子走一趟:给他建星球、盖房子,再帮他和地球保持联系。


第一站,是小王子的 B612 星球。


这是一颗很小的星球,上面有三座火山、几棵猴面包树和一朵玫瑰。我们的需求是:在这颗星球上设计一栋房子,整体做成一个可以摆在桌上的微缩星球摆件,并且能旋转、能看到昼夜变化。输入相关提示词,结果如下:


豆包大模型再更新,发力多模态编程,一手实测来了


从模型生成效果看,成品的摆件感很足,玫瑰开放、昼夜交替,光影与色彩的过渡都很柔和。小王子说自己有一天看了 44 次日落,模型把昼夜循环的最高速度也设成了一天 44 次。


搭建过程中,模型会自己截图、上手操作场景,发现问题后再回头改代码。


豆包大模型再更新,发力多模态编程,一手实测来了


模型自主截图操作示意,5 倍速。


星球有了,房子也得讲究一些。


我们找来一张小王子城堡的外观五视图,让模型据此重建 3D 模型。


豆包大模型再更新,发力多模态编程,一手实测来了


豆包大模型再更新,发力多模态编程,一手实测来了


提示词:基于这张城堡的外观五视图,构建一个 3D 模型,要求同步生成室内布局,并且可以打开屋顶查看。


结果并非 100% 完美复刻,但整体过关,城堡各部分的空间关系还原得相当准确。提示词之外,模型还主动加上了自动旋转和墙体透视。


现在,小王子已经安好了家,我们该怎么联系他呢?


不如送他一台苹果刚发布的 iPhone Duo,当然,是数字版的。


我们让豆包 2.1 Pro 基于三张图片和两个视频生成了一个 iPhone Duo 折叠概念演示,并且其中还安装了一个可以通过折叠方式游玩的 Flappy Bird 小游戏。


这个任务的难点在于,折叠方式和游戏玩法都只存在于视频里,模型要先看懂画面中的开合动作和游戏规则,再把它们写成代码。


豆包大模型再更新,发力多模态编程,一手实测来了


读取并理解文件夹中的两个折叠屏视频展示和相应图片,然后构建一个 iPhone Duo 模型程序。一开始的界面是折叠起来的,用户可以点击侧边位置打开,然后界面上有一些图标,其中有一个 Flappy Bird 图标,点击这个图标可以打开视频中演示的游戏。用户可以点击空白处实现虚拟 iPhone Duo 的折叠,并玩这个游戏。


交互的完成度不错:数字版 iPhone Duo 的两块屏幕做到了与 Flappy Bird 的翅膀同频,扇动起来穿过一个又一个的关口。有趣的是,豆包 2.1 Pro 还给这个小游戏起了一个恰到好处的名字:Foldy Bird。美中不足的是,最终样式与真实 iPhone Duo 略有差异,倒是更像 Surface Duo。


从一颗星球到一座城堡,再到一台能折叠的手机,小王子的家算是安顿好了。这一路上,豆包 2.1 Pro 接收的信息不只有文字,还有设计图和视频。它必须去看,并且看懂,才能真正开始动手去创作。


小王子的故事先讲到这里,现在回到我们的日常生活。


从星球回到地面


只需一张图,豆包能盖房


现实中需求,往往就是一张图:一张建筑平面设计图、一张庭院设计图或一张随手画的草稿。


先从一张建筑平面设计图开始,我们让豆包 2.1 Pro 将其转化为了可交互的三维模型。这里,模型能获得的信息几乎全部来自平面图本身。对缺乏多模态理解能力的模型来说,这类任务很难仅靠文字推理完成。


豆包大模型再更新,发力多模态编程,一手实测来了


豆包大模型再更新,发力多模态编程,一手实测来了


新版豆包 2.1 Pro 读懂了平面图中各类图例的含义,并据此还原出空间布局。更有意思的是,它还考虑到了用户会怎样查看这个模型,主动加入了隐藏屋顶、自动旋转和视角切换。它理解的不只是图,还有人会怎么使用这个结果。


这与官方披露的方向一致:据字节介绍,新版模型对工程图纸中尺寸标注、公差符号的识别精度有所提升,也能更准确地识别 CAD 工件等 3D 物体。


更进一步,你甚至可以把自家庭院「搬」进数字世界,再让它快速经历四季。


豆包大模型再更新,发力多模态编程,一手实测来了


提示词:参考设计图,做一个 web3D 的庭院,然后模拟春夏秋冬四季,生成不同季节的庭院风貌。


最后,是一张我们自己手绘的潦草草图。我们让豆包 2.1 Pro 据此构建一个支持多主题切换的个人工作台:


豆包大模型再更新,发力多模态编程,一手实测来了


豆包大模型再更新,发力多模态编程,一手实测来了


提示词:基于这张手绘图,构建我的个人工作台主页。设置中支持多主题切换,包括极简风格、像素画风格、水墨画风格、莫兰迪色风格、Atom 编辑器经典风格、Aurora Gradient、赛博朋克等。不懂的先问我,清楚后再构建。


结果相当好,我个人尤其偏好其中的赛博朋克风格。而且它还提供了非常丰富的个性化设置能力,让我们可以将其配置成真正实用的个人工作台。


测试最后,我们再看看「鹈鹕骑自行车」的任务表现。


这是 AI 圈流传很广的民间测试,源自开发者 Simon Willison 常用的一句提示词:Generate an SVG of a pelican riding a bicycle。本次测试,我们加点力度,在2D基础上,要求生成3D像素风的。


Seed2.1 Pro 升级版先交出一版 2D 动画,接着按要求给出了 3D 结果。


豆包大模型再更新,发力多模态编程,一手实测来了


可以看到,鹈鹕的外形特征、双腿骑车时的运动姿态都被表现出来,主体与背景树木之间也呈现出了合理透视关系,随着镜头变化,身体与车身的空间关系依然保持稳定。


看图写代码的背后


新版豆包 2.1 Pro 更新了什么?


测完回过头,再来看看这次更新本身。


本次更新的豆包 2.1 Pro 0915 基于 Seed-Evolving 最新版固定而来。后者于今年 6 月对外公开,在短短 3 个月内保持高频自进化迭代,多模态编程能力已达到国内领先水平


其核心亮点主要体现在两个方面。


一是更懂复杂代码仓库。官方披露,在开源游戏 Luanti(约 38.7 万行代码、1000 个真实历史 Issue)的自主修复中,模型调度多个子 Agent 连续运行近 36 小时,完成根因定位与跨文件修复,83% 的任务达到可合并标准。


豆包大模型再更新,发力多模态编程,一手实测来了


二是「看图写代码」。借助视觉理解能力,模型可以直接读懂设计稿、图纸和操作录屏,再转成前端代码和游戏逻辑。


官方展示的一个案例中,一套没有文档的老 ERP 系统,只提供一段操作录屏和几张草图,模型读懂了约 28 万行 Java 代码,依据录屏与草图开发出移动端页面,并跑通了完整业务链路。


豆包大模型再更新,发力多模态编程,一手实测来了


支撑这些的,是多模态理解能力的提升。前面城堡五视图、平面图、iPhone Duo 视频这几个测试,考的正是这些能力。


Agent 方面,模型强化了证据溯源、权威信源检索和数据核验,幻觉明显减少,在金融投研这类需要多轮调研、产出长报告的专业任务中,交付更加可靠。


豆包大模型再更新,发力多模态编程,一手实测来了


上下滚动查看,iPhone Duo 首年出货量预测分析,豆包 2.1 Pro 派出了 4 个子智能体进行预测核实,得到了非常详实的结果,同时也列出了无法核实的信息


这些能力的背后是字节在多模态上的长期积累。


目前,豆包 2.1 系列模型在视觉理解、Computer Use、Mobile Use 等任务上都处于相当领先的水平;在创作侧,Seedance、Seedream、Seed Audio 分别覆盖视频、图像和音频生成。


成本上,新版图像推理和视频推理的 Token 消耗比上一代减少 30% 以上,对看图写代码这类需要反复截图、对照画面的任务来说,这一点很具备吸引力。


目前,开发者可直接在火山方舟调用 Doubao-Seed-2.1-pro-0915 模型,普通用户下载升级豆包工作最新版,选择「豆包 2.1 Pro(0915 新版)」即可体验。


豆包大模型再更新,发力多模态编程,一手实测来了


让机器看懂人


编程,从来就不仅仅围绕文本一种模态。


真实工程里的大量知识,藏在设计图、软件界面、操作录屏,甚至老员工的操作习惯里。前端工程师的日常,也有很大一部分是把别人的设计一点点变成代码。只会读文字的编程模型,天然缺了一条腿。多模态补上的正是这一条。


从技术发展路线看,编程正在越来越多地和多模态能力结合,这也是 AI 编程走向生产级落地的必修课。


越来越多地,编程智能体开始带着一双「眼睛」去工作:可以看界面、看图片、理解空间和视觉反馈,再决定代码应该怎么写。与此同时,编程能力本身也不再只是服务于「做软件」,它正在变成 AI 解决通用任务的一种工具。


再从字节视角看,豆包 2.1 Pro 的更新,正凸显其在多模态领域的优势:将以 Seed Audio、Seedance、Seedream 为代表的领先技术积累,进一步整合并转化为面向真实工作场景的生产力。豆包大模型正在将「编程模型」和「通用 Agent」能力不断融合,服务越来越多的生产力场景。


而更深的变化,发生在人与机器之间。过去几十年,是人在学习机器的语言:写代码,写 PRD,写接口文档,把想法一层层翻译成机器能执行的格式。


现在,机器开始学着看懂人的表达:一张随手画的草图,一段录下来的操作,一次屏幕上的演示,都可以直接成为开发的起点。


从人读懂机器,到机器读懂人。当模型有了「眼睛」,代码就成了它的「手」。


文章来自于微信公众号 “机器之心”,作者 “机器之心”

AI转型,免费服务,就找AITNT
AITNT资源拓展
根据文章内容,系统为您匹配了更有价值的资源信息。内容由AI生成,仅供参考
1
AI代理

【开源免费】Browser-use 是一个用户AI代理直接可以控制浏览器的工具。它能够让AI 自动执行浏览器中的各种任务,如比较价格、添加购物车、回复各种社交媒体等。

项目地址:https://github.com/browser-use/browser-use


2
AI数据分析

【开源免费】DeepBI是一款AI原生的数据分析平台。DeepBI充分利用大语言模型的能力来探索、查询、可视化和共享来自任何数据源的数据。用户可以使用DeepBI洞察数据并做出数据驱动的决策。

项目地址:https://github.com/DeepInsight-AI/DeepBI?tab=readme-ov-file

本地安装:https://www.deepbi.com/

【开源免费airda(Air Data Agent)是面向数据分析的AI智能体,能够理解数据开发和数据分析需求、根据用户需要让数据可视化。

项目地址:https://github.com/hitsz-ids/airda

3
智能体

【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。

项目地址:https://github.com/Significant-Gravitas/AutoGPT


【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。

项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md

4
prompt

【开源免费】LangGPT 是一个通过结构化和模板化的方法,编写高质量的AI提示词的开源项目。它可以让任何非专业的用户轻松创建高水平的提示词,进而高质量的帮助用户通过AI解决问题。

项目地址:https://github.com/langgptai/LangGPT/blob/main/README_zh.md

在线使用:https://kimi.moonshot.cn/kimiplus/conpg00t7lagbbsfqkq0