刘恺骐,北京大学博士生,主要研究方向为可控视频生成、音视频联合生成、世界模型、理解生成统一模型及多模态大模型等,相关成果发表于 ECCV、ICCV、CVPR 等国际会议。
过去几年,视频生成模型在清晰度、运动表现和画面质感上不断进步。输入一句文字,模型已经能够生成颇具电影感的视频。
但当任务从「生成一个漂亮片段」,变成「完整拍完一场戏」,问题就不一样了。
前一个镜头里,女主说完一句话;画面随即切到男主,他停顿片刻后作出回应;接着镜头切回女主,而男主在画外继续说话。要完成这段内容,模型不仅需要知道画面中有什么,还要准确执行一系列叙事约束:何时切镜?谁在什么时候开口?对白能否与口型和动作对应?切镜之后,人物的脸和声音还能否保持一致?
即使这些要求已经写进脚本,现有模型仍可能出现切镜错位、对白提前或延后,以及多人场景中的串脸、串音。问题不只在于故事有没有说清楚,更在于模型内部是否具备沿着复杂时间线组织音视频内容的能力。
为此,北京大学、可灵团队、中国科学院自动化研究所和中山大学联合提出 MAVIN,一种支持定制化叙事控制的多镜头音视频联合生成模型。

目前,该论文已被 ECCV 2026 以 Oral 形式接收。刘恺骐为第一作者,翁书晨、施柏鑫为通讯作者。
多镜头音视频叙事至少面临三类挑战。
首先是时间错位。模型可能知道脚本中有哪些人物和事件,却无法判断它们应该出现在哪个时间段:镜头已经切换,上一名角色的声音仍在继续;人物尚未出现,对白却提前响起。
其次是身份混淆。同一名角色跨镜头出现时,不仅要保持面部、发型和服装一致,也要维持稳定的音色;多名人物交替对话时,还要避免串脸、串音和说话人绑定错误。
此外,用户通常只会输入一段故事梗概,很少完整标注镜头边界、对白区间、角色外貌和声音事件。系统既需要补全一份可执行的剧本,也需要真正按照这份剧本完成生成。
因此,MAVIN 要解决的并不是简单的「多生成几个镜头」,而是让模型学会在一条统一的叙事时间线上,调度画面、对白、动作和角色身份。

MAVIN 采用全局、镜头和角色三个层级的结构化脚本,统一描述整体情节与背景音乐,各镜头的起止时间、画面内容与人物动作,对白内容及其时间区间,以及角色的视觉外貌与声音身份。
模型建立在双塔音视频联合生成架构之上,视频和音频分别在各自分支中建模,并通过跨模态注意力交换信息。围绕「何时发生」与「由谁发生」,MAVIN 提出了两项核心机制。

视频生成模型通常让整段文本影响所有音视频位置。这意味着,模型在生成第一个镜头时,也能读取后续镜头的描述,容易造成后一个人物提前出现、上一段对白串入下一镜等「语义串场」。
MAVIN 根据镜头边界划分视频特征,根据对白区间划分音频特征,再通过动态 token 路由,为不同信息限定明确的作用范围:镜头描述只影响对应片段,角色外貌只在其出场镜头中生效,声音条件也只作用于相应的对白区间。
由此,镜头切换、人物动作和说话时间不再只是提示词中的「软要求」,而成为模型内部能够执行的时间约束。
MAVIN 可以同时接收角色参考图像和参考音频,并通过专门的音色编码器,从参考语音中提取「是谁在说」,而不是复制参考语音「说了什么」。
在此基础上,身份感知掩码进一步限制不同人物之间的信息传播。每个镜头只读取实际出场角色的视觉参考,每段对白只读取当前说话人的声音特征;同一角色的文字、画面和音色相互绑定,不同角色之间则保持隔离。
这相当于为每名角色设置独立的视觉与声音锚点,从而减少多次切镜后的身份漂移,以及多人对话中的串脸、串音。
面对自由形式的用户输入,MAVIN 还设计了一套轻量级多智能体流水线。
结构解析智能体负责识别场景、角色和对白,并划分镜头与对白区间;身份对齐智能体匹配人物与参考图像、参考声音;叙事细化智能体则补充动作、镜头语言和环境声音,最终形成全局、镜头和角色三个层级的脚本。
它负责「把拍摄计划写清楚」,边界感知注意力和身份感知传播则负责「按计划真正拍出来」。
要让模型学会执行镜头、对白与角色约束,训练数据也必须包含完整的叙事结构。然而,现有音视频数据通常只提供整段内容描述,缺少镜头边界、对白时间以及跨镜头的角色信息。

为此,团队构建了多镜头音视频数据集 MAVINSet,收录数十万条时长 3 至 15 秒、包含 1 至 6 个镜头的样本。不同于普通视频字幕,MAVINSet 为每段内容提供全局、镜头和角色三级标注,覆盖故事进展、镜头内容、人物动作、对白文本与时间,以及角色的外貌和声音特征。
对于跨越切镜点的对白,数据还会记录其在不同镜头间的延续关系。这样,模型看到的不再只是一段音视频,而是一份包含画面、声音、人物与时间信息的完整「分镜表」。
研究团队将 MAVIN 与两类代表性方法进行了比较:一类先生成多镜头视频,再通过视频到音频模型补充声音;另一类则是端到端音视频联合生成模型。
视觉对比

在同一段三镜头雪地对话中,现有方法容易出现角色外貌漂移、镜头顺序错乱或对白与人物对应不准等问题。相比之下,MAVIN 能够更完整地执行镜头切换,并在不同镜头间保持人物身份与场景风格,同时让对白与角色之间的对应更加准确。
定量指标

在涵盖音视频质量、语义一致性、音画同步与多镜头控制的 13 项指标上,MAVIN 取得最佳结果。其中,镜头切换准确率 STA 达到 0.9897,对白时间对齐指标 TAMS 达到 0.8104,表明模型不仅能够生成连贯的音视频内容,也能更准确地执行脚本中的时间和身份约束。
当镜头边界、对白区间和角色身份被统一建模后,MAVIN 不再只是按照脚本一次性生成成片。创作者可以直接修改时间安排、角色设定和局部叙事条件,由此衍生出多种面向实际创作的应用。下面介绍其中两个具有代表性的应用场景:
叙事节奏控制(Speed Control)
通过调整镜头边界和对白区间,用户可以改变整段内容的叙事节奏。压缩镜头时长和对白区间,可以让画面推进与人物表达更加紧凑;延长相应区间,则能形成更舒缓的节奏。模型会按照新的时间安排重新组织动作、口型和声音,而不是简单地对已有视频进行机械变速。
角色身份定制(Identity Customization)
MAVIN 将角色的视觉外貌与声音身份作为可独立编辑的条件。用户可以分别替换参考图像或参考音频,实现同一人物使用不同音色说话,或让不同人物共享同一种音色。在保持故事、分镜和对白内容不变的情况下,创作者可以自由组合角色的外貌与声音,并在多次切镜和交替对白中维持正确的视听身份对应。
MAVIN 关注的不只是如何生成更清晰、更自然的单个镜头,而是让模型开始处理镜头、对白与角色视听身份之间的时空关系。视频生成的控制粒度,也由「画面中生成什么」进一步走向「内容在何时发生、由谁完成,以及如何跨越多个镜头展开」。
这种结构化的叙事控制,为多角色短剧、数字人表演、影视预演和交互式内容创作等场景提供了新的技术路径,也让音视频模型开始从单个片段生成,迈向更完整的叙事组织。
当模型不再只是完成一个画面,而能够沿着时间线组织并拍完一场戏,AI 视频才真正开始走向可控的叙事创作。
更多方法与实验细节,请参阅原论文及项目主页。
文章来自于"机器之心",作者 "刘恺骐"。
【开源免费】Browser-use 是一个用户AI代理直接可以控制浏览器的工具。它能够让AI 自动执行浏览器中的各种任务,如比较价格、添加购物车、回复各种社交媒体等。
项目地址:https://github.com/browser-use/browser-use
【开源免费】Fay开源数字人框架是一个AI数字人项目,该项目可以帮你实现“线上线下的数字人销售员”,
“一个人机交互的数字人助理”或者是一个一个可以自主决策、主动联系管理员的智能体数字人。
项目地址:https://github.com/xszyou/Fay
【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。
项目地址:https://github.com/Significant-Gravitas/AutoGPT
【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。
项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md
【开源免费】LangGPT 是一个通过结构化和模板化的方法,编写高质量的AI提示词的开源项目。它可以让任何非专业的用户轻松创建高水平的提示词,进而高质量的帮助用户通过AI解决问题。
项目地址:https://github.com/langgptai/LangGPT/blob/main/README_zh.md
在线使用:https://kimi.moonshot.cn/kimiplus/conpg00t7lagbbsfqkq0
【开源免费】VideoChat是一个开源数字人实时对话,该项目支持支持语音输入和实时对话,数字人形象可自定义等功能,首次对话延迟低至3s。
项目地址:https://github.com/Henry-23/VideoChat
在线体验:https://www.modelscope.cn/studios/AI-ModelScope/video_chat
【开源免费】Streamer-Sales 销冠是一个AI直播卖货大模型。该模型具备AI生成直播文案,生成数字人形象进行直播,并通过RAG技术对现有数据进行寻找后实时回答用户问题等AI直播卖货的所有功能。
项目地址:https://github.com/PeterH0323/Streamer-Sales