ECCV 2026 Oral|从「一句提示词」到「多镜头成片」:MAVIN让AI开始按剧本讲故事

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
ECCV 2026 Oral|从「一句提示词」到「多镜头成片」:MAVIN让AI开始按剧本讲故事
8513点击    2026-08-28 10:02

刘恺骐,北京大学博士生,主要研究方向为可控视频生成、音视频联合生成、世界模型、理解生成统一模型及多模态大模型等,相关成果发表于 ECCV、ICCV、CVPR 等国际会议。


过去几年,视频生成模型在清晰度、运动表现和画面质感上不断进步。输入一句文字,模型已经能够生成颇具电影感的视频。


但当任务从「生成一个漂亮片段」,变成「完整拍完一场戏」,问题就不一样了。


前一个镜头里,女主说完一句话;画面随即切到男主,他停顿片刻后作出回应;接着镜头切回女主,而男主在画外继续说话。要完成这段内容,模型不仅需要知道画面中有什么,还要准确执行一系列叙事约束:何时切镜?谁在什么时候开口?对白能否与口型和动作对应?切镜之后,人物的脸和声音还能否保持一致?


即使这些要求已经写进脚本,现有模型仍可能出现切镜错位、对白提前或延后,以及多人场景中的串脸、串音。问题不只在于故事有没有说清楚,更在于模型内部是否具备沿着复杂时间线组织音视频内容的能力。


为此,北京大学、可灵团队、中国科学院自动化研究所和中山大学联合提出 MAVIN,一种支持定制化叙事控制的多镜头音视频联合生成模型


ECCV 2026 Oral|从「一句提示词」到「多镜头成片」:MAVIN让AI开始按剧本讲故事


目前,该论文已被 ECCV 2026 以 Oral 形式接收。刘恺骐为第一作者,翁书晨、施柏鑫为通讯作者。


  • 论文标题: MAVIN: Multi-Shot Audio-Visual Generation with Customized Narrative Control
  • 作者单位: 北京大学、可灵团队、中国科学院自动化研究所、中山大学
  • 论文地址:https://arxiv.org/abs/2606.29473
  • 项目主页:https://liukqchoco.github.io/MAVIN/


一、会生成电影感画面,

为什么还「拍不完一场戏」?


多镜头音视频叙事至少面临三类挑战。


首先是时间错位。模型可能知道脚本中有哪些人物和事件,却无法判断它们应该出现在哪个时间段:镜头已经切换,上一名角色的声音仍在继续;人物尚未出现,对白却提前响起。


其次是身份混淆。同一名角色跨镜头出现时,不仅要保持面部、发型和服装一致,也要维持稳定的音色;多名人物交替对话时,还要避免串脸、串音和说话人绑定错误。


此外,用户通常只会输入一段故事梗概,很少完整标注镜头边界、对白区间、角色外貌和声音事件。系统既需要补全一份可执行的剧本,也需要真正按照这份剧本完成生成。


因此,MAVIN 要解决的并不是简单的「多生成几个镜头」,而是让模型学会在一条统一的叙事时间线上,调度画面、对白、动作和角色身份。


ECCV 2026 Oral|从「一句提示词」到「多镜头成片」:MAVIN让AI开始按剧本讲故事


二、核心思路:

把「叙事时间线」真正写进生成模型


MAVIN 采用全局、镜头和角色三个层级的结构化脚本,统一描述整体情节与背景音乐,各镜头的起止时间、画面内容与人物动作,对白内容及其时间区间,以及角色的视觉外貌与声音身份。


模型建立在双塔音视频联合生成架构之上,视频和音频分别在各自分支中建模,并通过跨模态注意力交换信息。围绕「何时发生」与「由谁发生」,MAVIN 提出了两项核心机制。


ECCV 2026 Oral|从「一句提示词」到「多镜头成片」:MAVIN让AI开始按剧本讲故事


1. 边界感知注意力:让镜头与对白在叙事时间线上精准落位


视频生成模型通常让整段文本影响所有音视频位置。这意味着,模型在生成第一个镜头时,也能读取后续镜头的描述,容易造成后一个人物提前出现、上一段对白串入下一镜等「语义串场」。


MAVIN 根据镜头边界划分视频特征,根据对白区间划分音频特征,再通过动态 token 路由,为不同信息限定明确的作用范围:镜头描述只影响对应片段,角色外貌只在其出场镜头中生效,声音条件也只作用于相应的对白区间。


由此,镜头切换、人物动作和说话时间不再只是提示词中的「软要求」,而成为模型内部能够执行的时间约束。


2. 身份感知传播:镜头可以换,演员不能「掉线」


MAVIN 可以同时接收角色参考图像和参考音频,并通过专门的音色编码器,从参考语音中提取「是谁在说」,而不是复制参考语音「说了什么」。


在此基础上,身份感知掩码进一步限制不同人物之间的信息传播。每个镜头只读取实际出场角色的视觉参考,每段对白只读取当前说话人的声音特征;同一角色的文字、画面和音色相互绑定,不同角色之间则保持隔离。


这相当于为每名角色设置独立的视觉与声音锚点,从而减少多次切镜后的身份漂移,以及多人对话中的串脸、串音。


3. 多智能体脚本流水线:先把故事补成一份「可拍」的剧本


面对自由形式的用户输入,MAVIN 还设计了一套轻量级多智能体流水线。


结构解析智能体负责识别场景、角色和对白,并划分镜头与对白区间;身份对齐智能体匹配人物与参考图像、参考声音;叙事细化智能体则补充动作、镜头语言和环境声音,最终形成全局、镜头和角色三个层级的脚本。


它负责「把拍摄计划写清楚」,边界感知注意力和身份感知传播则负责「按计划真正拍出来」。


三、MAVINSet:

让模型从数据中学会「一场戏该怎么拍」


要让模型学会执行镜头、对白与角色约束,训练数据也必须包含完整的叙事结构。然而,现有音视频数据通常只提供整段内容描述,缺少镜头边界、对白时间以及跨镜头的角色信息。


ECCV 2026 Oral|从「一句提示词」到「多镜头成片」:MAVIN让AI开始按剧本讲故事


为此,团队构建了多镜头音视频数据集 MAVINSet,收录数十万条时长 3 至 15 秒、包含 1 至 6 个镜头的样本。不同于普通视频字幕,MAVINSet 为每段内容提供全局、镜头和角色三级标注,覆盖故事进展、镜头内容、人物动作、对白文本与时间,以及角色的外貌和声音特征。


对于跨越切镜点的对白,数据还会记录其在不同镜头间的延续关系。这样,模型看到的不再只是一段音视频,而是一份包含画面、声音、人物与时间信息的完整「分镜表」。


四、实验结果:

不仅时间更准,角色也不再「串线」


研究团队将 MAVIN 与两类代表性方法进行了比较:一类先生成多镜头视频,再通过视频到音频模型补充声音;另一类则是端到端音视频联合生成模型。


视觉对比


ECCV 2026 Oral|从「一句提示词」到「多镜头成片」:MAVIN让AI开始按剧本讲故事

在同一段三镜头雪地对话中,现有方法容易出现角色外貌漂移、镜头顺序错乱或对白与人物对应不准等问题。相比之下,MAVIN 能够更完整地执行镜头切换,并在不同镜头间保持人物身份与场景风格,同时让对白与角色之间的对应更加准确。


定量指标


ECCV 2026 Oral|从「一句提示词」到「多镜头成片」:MAVIN让AI开始按剧本讲故事

在涵盖音视频质量、语义一致性、音画同步与多镜头控制的 13 项指标上,MAVIN 取得最佳结果。其中,镜头切换准确率 STA 达到 0.9897,对白时间对齐指标 TAMS 达到 0.8104,表明模型不仅能够生成连贯的音视频内容,也能更准确地执行脚本中的时间和身份约束。


五、从模型能力到创作接口:

MAVIN 拓展多镜头叙事的应用边界


当镜头边界、对白区间和角色身份被统一建模后,MAVIN 不再只是按照脚本一次性生成成片。创作者可以直接修改时间安排、角色设定和局部叙事条件,由此衍生出多种面向实际创作的应用。下面介绍其中两个具有代表性的应用场景:


叙事节奏控制(Speed Control)


通过调整镜头边界和对白区间,用户可以改变整段内容的叙事节奏。压缩镜头时长和对白区间,可以让画面推进与人物表达更加紧凑;延长相应区间,则能形成更舒缓的节奏。模型会按照新的时间安排重新组织动作、口型和声音,而不是简单地对已有视频进行机械变速。


角色身份定制(Identity Customization)


MAVIN 将角色的视觉外貌与声音身份作为可独立编辑的条件。用户可以分别替换参考图像或参考音频,实现同一人物使用不同音色说话,或让不同人物共享同一种音色。在保持故事、分镜和对白内容不变的情况下,创作者可以自由组合角色的外貌与声音,并在多次切镜和交替对白中维持正确的视听身份对应。


六、从「生成画面」到「组织叙事」


MAVIN 关注的不只是如何生成更清晰、更自然的单个镜头,而是让模型开始处理镜头、对白与角色视听身份之间的时空关系。视频生成的控制粒度,也由「画面中生成什么」进一步走向「内容在何时发生、由谁完成,以及如何跨越多个镜头展开」。


这种结构化的叙事控制,为多角色短剧、数字人表演、影视预演和交互式内容创作等场景提供了新的技术路径,也让音视频模型开始从单个片段生成,迈向更完整的叙事组织。


当模型不再只是完成一个画面,而能够沿着时间线组织并拍完一场戏,AI 视频才真正开始走向可控的叙事创作。


更多方法与实验细节,请参阅原论文及项目主页。


文章来自于"机器之心",作者 "刘恺骐"。

关键词: AI新闻 , AI剧本 , MAVIN , AI视频
AI转型,免费服务,就找AITNT
AITNT资源拓展
根据文章内容,系统为您匹配了更有价值的资源信息。内容由AI生成,仅供参考
1
AI代理

【开源免费】Browser-use 是一个用户AI代理直接可以控制浏览器的工具。它能够让AI 自动执行浏览器中的各种任务,如比较价格、添加购物车、回复各种社交媒体等。

项目地址:https://github.com/browser-use/browser-use


2
数字人

【开源免费】Fay开源数字人框架是一个AI数字人项目,该项目可以帮你实现“线上线下的数字人销售员”,

“一个人机交互的数字人助理”或者是一个一个可以自主决策、主动联系管理员的智能体数字人。

项目地址:https://github.com/xszyou/Fay

3
智能体

【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。

项目地址:https://github.com/Significant-Gravitas/AutoGPT


【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。

项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md

4
prompt

【开源免费】LangGPT 是一个通过结构化和模板化的方法,编写高质量的AI提示词的开源项目。它可以让任何非专业的用户轻松创建高水平的提示词,进而高质量的帮助用户通过AI解决问题。

项目地址:https://github.com/langgptai/LangGPT/blob/main/README_zh.md

在线使用:https://kimi.moonshot.cn/kimiplus/conpg00t7lagbbsfqkq0

5
无人直播

【开源免费】VideoChat是一个开源数字人实时对话,该项目支持支持语音输入和实时对话,数字人形象可自定义等功能,首次对话延迟低至3s。

项目地址:https://github.com/Henry-23/VideoChat

在线体验:https://www.modelscope.cn/studios/AI-ModelScope/video_chat


【开源免费】Streamer-Sales 销冠是一个AI直播卖货大模型。该模型具备AI生成直播文案,生成数字人形象进行直播,并通过RAG技术对现有数据进行寻找后实时回答用户问题等AI直播卖货的所有功能。

项目地址:https://github.com/PeterH0323/Streamer-Sales