迎接生成范式革命!复旦和Wan团队发布首篇Agentic视觉生成综述

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
迎接生成范式革命!复旦和Wan团队发布首篇Agentic视觉生成综述
10107点击    2026-09-22 09:50

让 AI 生成一张海报已经不难。更难的是,让它围绕同一个设计目标持续工作:理解品牌与产品要求,生成初稿;发现标题、产品位置或整体风格存在问题后,知道应该修改哪里、怎样修改;同时保留已经确认的内容。等到下一次活动,它还能延续此前确定的设计偏好和有效经验。


这里需要做的决定,从曾经的“输入什么提示词”,扩展到了选什么工具、检查结果、局部修改,以及积累经验。


这些决定由谁来做,做到哪一步,正是Agentic Visual Generation(智能体式视觉生成)要研究的问题。


来自复旦、Wan、港中文mmlab的研究团队在综述《Agentic Visual Generation: From Generative Models to Agentic Control》中,为这个快速发展的方向建立了一套围绕控制器决策范围的分类框架。


论文梳理了覆盖图像生成、编辑、视频、幻灯片、用户界面、3D 与世界模型的系统,并将不同技术路线放到同一组问题下考察:系统在生成前能决定什么?执行时能选择什么?看到结果后能改变什么?任务结束后又能留下什么?


迎接生成范式革命!复旦和Wan团队发布首篇Agentic视觉生成综述


这其中一个非常值得关注的地方是:目前的工作中,根据结果修正当前任务的系统已经占据多数,能够把已完成任务的经验用于后续独立任务的系统,仍然相对少见。


迎接生成范式革命!复旦和Wan团队发布首篇Agentic视觉生成综述


  • 论文标题:Agentic Visual Generation: From Generative Models to Agentic Control
  • 论文地址:https://arxiv.org/abs/2609.06758
  • 项目仓库:https://github.com/YinmingHuang/Awesome-agentic-visual-generation-model


迎接生成范式革命!复旦和Wan团队发布首篇Agentic视觉生成综述


一套分类,先把“自主到哪一步”讲清楚


在现有系统中,控制器通常由 LLM 或 VLM 担任,负责理解需求和选择行动;图像、视频生成模型以及编辑器、渲染器,则负责执行具体的视觉操作。


在此基础上,综述按照控制器能够影响的最远决策,将相关系统划分为 L0 至 L4。L0 表示固定的支撑组件与流程,界定综述讨论的起点;L1 至 L4 则对应逐步扩展的四级控制能力。


L0:固定支撑(Fixed Support),提供生成所需的基础能力


在 L0 中,生成器、编辑器、检索器、评估器和固定流水线按预设路径运行,提供生成、编辑与评估能力,但没有控制器决定下一步采用哪种生成操作。L0 描述的是决策方式,与画质高低无关。


L1:条件控制(Conditioning Control),把需求整理成生成器能够使用的条件


L1 的控制器负责准备输入条件,例如改写提示词、规划物体位置、选择参考图、检索知识,或设计分镜与相机运动。LLM-grounded Diffusion 将复杂要求拆成对象描述和边界框,LayoutGPT 生成二维或三维布局,World-To-Image 则检索定义和参考图。这些条件最终交给预先确定的生成器执行。


L2:执行控制(Execution Control),选择并组织实际的视觉操作


L2 的控制器开始选择并编排实际操作,包括图像生成、局部编辑、模型切换、节点编排和视频渲染。Visual ChatGPT 将视觉模型封装成工具,ComfyUI-Copilot 生成可执行节点图,ViMax 则组织剧本、镜头、角色风格和片段生成。控制器由此决定使用哪些能力完成任务。


L3:结果自适应控制(Outcome-Adaptive Control),根据生成结果调整后续行动


L3 将视觉生成变成反馈闭环。系统查看已经生成的图像、视频、页面或场景,再根据物体缺失、空间关系错误或动作不连贯等问题,选择局部编辑、重新生成、调整条件或停止。SLD、GenPilot 和 PPTAgent 分别展示了生成结果驱动的图像修正、视觉细化与幻灯片编辑。代码报错、物理仿真和用户意见也可以成为反馈。


L4:经验自适应控制(Experience-Adaptive Control),把完成任务的经验用于未来任务


L4 将适应能力延伸到新的任务。系统会把已经完成的生成过程保存为长期记忆、能力档案、工作流或技能。OctoT2I 根据历史表现更新生成器能力档案,GenEvolve 从成功与失败轨迹中提炼可复用过程,COMFYCLAW 将验证过的工作流构建方法沉淀到技能库。


沿着 L1 至 L4,控制范围依次从输入条件扩展到执行操作、当前任务中的结果反馈,以及跨任务复用的长期经验。


迎接生成范式革命!复旦和Wan团队发布首篇Agentic视觉生成综述


300+ 份工作背后,下一个突破在哪里?


以论文截至 2026 年 8 月 24 日的样本为准,L1 至 L4 分别收录 49、33、202、25 条工作。2025 年后的增长主要集中在 L3,说明根据结果修正当前任务已成为近期研究的主要路线;相比之下,能够跨任务复用经验的 L4 仍然较少。


经验并非存得越多越好。它是否与新任务相关、是否已经过时,会不会把旧错误带入新任务,都需要进一步验证。


怎样测出 Agent 的贡献?先把比较条件对齐


迎接生成范式革命!复旦和Wan团队发布首篇Agentic视觉生成综述


生成效果变好,可能来自更强的生成器、更多次采样,也可能是控制器确实做出了更有效的决定。论文据此提出按控制级别设计评估:固定生成器、可用工具、预算和评估器,再逐次增加一类决策能力。


其中,评测 L1 要看更好的条件能否改善同一个生成器;评测 L2 要在同一组工具中比较控制器能否选到更合适的执行路线,并将路线选择带来的收益与工具本身的能力区分开。


验证 L3 时,可让两个版本使用相同的初始计划、工具和总预算,一个读取中间结果并修改,另一个按既定路线执行。验证 L4 时,则在新的独立任务上比较保留、移除或打乱经验后的表现,并检查负迁移与遗忘。


评估还要记录每次修正的代价,包括是否破坏已确认内容、是否满足用户硬性要求,以及系统何时应该停止。


结语


这篇综述以控制器能够影响的最远生成决策为主线,将相关系统组织为 L0 至 L4。L0 界定固定支撑组件与流程,L1 至 L4 则依次覆盖生成条件、执行操作、当前任务中的结果反馈,以及能够影响未来任务的长期经验。


对 300 多份工作的梳理显示,视觉生成 Agent 已经明显走向根据结果修正当前任务,但跨任务沉淀和复用经验仍处于较早阶段。如何获得可靠反馈、保护已经确认的内容、控制修正成本,并让长期经验保持有效,是这一方向继续发展的关键问题。论文还讨论了 generator-as-controller:如果生成器能够直接依据视觉状态决策,反馈链路可能更短,局部调整也会更精确;但它仍需用同一套标准证明中间结果确实改变了后续行动。


对于研究者,这篇综述提供了一张按决策能力组织的文献地图和一套对齐条件后的评估方法;对于开发者,它提供了检查系统能力的具体视角:控制器能选择哪些操作,结果能否改变下一步,任务结束后又有哪些经验会继续影响未来行动。Agentic视觉生成的进展,最终需要落实到这些可以观察和验证的决定上。


文章来自于"机器之心",作者 "机器之心"。

AI转型,免费服务,就找AITNT
AITNT资源拓展
根据文章内容,系统为您匹配了更有价值的资源信息。内容由AI生成,仅供参考
1
AI代理

【开源免费】Browser-use 是一个用户AI代理直接可以控制浏览器的工具。它能够让AI 自动执行浏览器中的各种任务,如比较价格、添加购物车、回复各种社交媒体等。

项目地址:https://github.com/browser-use/browser-use


2
AI工作流

【开源免费】字节工作流产品扣子两大核心业务:Coze Studio(扣子开发平台)和 Coze Loop(扣子罗盘)全面开源,而且采用的是 Apache 2.0 许可证,支持商用!

项目地址:https://github.com/coze-dev/coze-studio


【开源免费】n8n是一个可以自定义工作流的AI项目,它提供了200个工作节点来帮助用户实现工作流的编排。

项目地址:https://github.com/n8n-io/n8n

在线使用:https://n8n.io/(付费


【开源免费】DB-GPT是一个AI原生数据应用开发框架,它提供开发多模型管理(SMMF)、Text2SQL效果优化、RAG框架以及优化、Multi-Agents框架协作、AWEL(智能体工作流编排)等多种技术能力,让围绕数据库构建大模型应用更简单、更方便。

项目地址:https://github.com/eosphoros-ai/DB-GPT?tab=readme-ov-file



【开源免费】VectorVein是一个不需要任何编程基础,任何人都能用的AI工作流编辑工具。你可以将复杂的工作分解成多个步骤,并通过VectorVein固定并让AI依次完成。VectorVein是字节coze的平替产品。

项目地址:https://github.com/AndersonBY/vector-vein?tab=readme-ov-file

在线使用:https://vectorvein.ai/付费

3
智能体

【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。

项目地址:https://github.com/Significant-Gravitas/AutoGPT


【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。

项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md

4
prompt

【开源免费】LangGPT 是一个通过结构化和模板化的方法,编写高质量的AI提示词的开源项目。它可以让任何非专业的用户轻松创建高水平的提示词,进而高质量的帮助用户通过AI解决问题。

项目地址:https://github.com/langgptai/LangGPT/blob/main/README_zh.md

在线使用:https://kimi.moonshot.cn/kimiplus/conpg00t7lagbbsfqkq0