阿里22B模型实现实时分钟级稳定数字人生成,自定义角色流式交互模型开源

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
阿里22B模型实现实时分钟级稳定数字人生成,自定义角色流式交互模型开源
10106点击    2026-08-03 11:01

当数字人视频从数秒扩展到数分钟,生成系统面对的核心问题不再只是单帧质量,而是递归生成中的误差累积。


人物外观、场景布局和颜色可能逐段漂移,语音与口型同步也会随上下文更新而退化。与此同时,保留完整历史会使注意力和存储开销随时长增长,并反复将早期预测误差作为后续条件。


针对这一问题,来自阿里巴巴淘天集团与南京大学的研究团队提出TaoMate,一种面向少步联合音视频生成的锚点引导持久记忆框架


阿里22B模型实现实时分钟级稳定数字人生成,自定义角色流式交互模型开源


TaoMate将带位置信息的短期上下文与固定容量的长期记忆分离,并以不可变视觉锚点约束动态状态更新;在此基础上,系统通过无需额外训练的阶段并行推理,在3张GPU上达到35.0 FPS的完整流水线输出速度。


阿里22B模型实现实时分钟级稳定数字人生成,自定义角色流式交互模型开源


背景:有限缓存与无限历史之间的矛盾


因果音视频生成通常依赖有界KV Cache保存近期动作、姿态和音素信息。它有利于局部连续,却会在窗口推进时丢失更早的人物、场景与声学证据。另一种做法是保留全部历史,但其计算量随视频长度持续增长,且旧的生成误差会被重复读取。长时生成因此需要同时满足三项约束:近期历史具有明确时间位置,长期条件不随视频时长扩张,递归预测中的异常结果不能持续污染未来。


TaoMate的基本思路是将历史分解为“有界活动上下文”和“固定容量持久记忆”。前者负责细粒度运动与发音连续性,后者保存跨窗口仍然有效的视觉和声学证据,使条件规模与已生成时长解耦。


阿里22B模型实现实时分钟级稳定数字人生成,自定义角色流式交互模型开源

五分钟递归生成对比。TaoMate在人物外观、场景与颜色上保持更稳定。


技术方案


锚点引导的多模态持久记忆


TaoMate将持久记忆分解为固定参考与动态状态。固定部分包括由初始块构建的视觉锚点和音频参考;动态部分包括视频内容记忆、音频内容记忆、通道级外观统计和低频外观状态。已完成的音视频块先被压缩为固定数量的表示,再以停止梯度方式更新记忆,因此不会形成随时间无限增长的优化图。


动态状态采用锚点约束的在线更新。视频块与视觉锚点的一致性被转换为软门控:一致性较高的观察以更大权重进入记忆,偏离较大的观察被抑制;对于容易表现为色偏或对比度漂移的外观统计,系统还设置硬拒绝条件。该设计允许记忆适应合理的姿态、动作和语音变化,同时限制孤立误差长期传播。


阿里22B模型实现实时分钟级稳定数字人生成,自定义角色流式交互模型开源

TaoMate框架。固定锚点与动态音视频记忆通过侧注意力和Reference-Aware FiLM共同提供长期条件。


内容检索与外观调制解耦


内容结构与全局外观具有不同语义,不宜通过同一机制读取。TaoMate使用模态专属的残差侧注意力检索视频结构和声学历史,记忆K/V始终位于活动缓存之外;固定的记忆token数使额外注意力开销不随生成时长增加。


对于颜色、亮度和低频场景信息,模型引入Reference-Aware FiLM,同时利用动态外观状态与初始锚点统计对视频特征进行通道级调制。消融结果显示,仅加入无门控FiLM会削弱部分一致性收益;将持久记忆、FiLM与锚点门控联合使用时,Long Consistency达到0.9676,Color Δ降至0.00276,说明外观调制需要以可靠的记忆更新为前提。


面向部署上下文的因果蒸馏


训练阶段的双向教师模型使用干净轨迹,而部署阶段的因果学生模型必须反复消费自身输出,两者存在上下文分布差异。TaoMate通过混合不同rollout长度、按概率使用学生生成前缀,并扰动非锚点缓存历史,使学生在训练时接触更接近部署状态的累计误差。初始视觉锚点始终保持干净,从而在不可靠的近期历史之外提供稳定参考。训练目标进一步结合分布匹配蒸馏与视频PCM约束,提升相邻去噪阶段在latent及外观敏感特征上的一致性。


记忆感知的阶段并行推理


TaoMate的学生生成器每个块执行3步去噪。串行方案需要完成一个块的全部阶段后再处理下一个块;TaoMate则将不同去噪阶段分配到不同设备,使满足因果依赖的多个块沿反对角线并行推进。每个阶段维护独立KV Cache,只有最终阶段的干净输出才能更新跨窗口记忆,部分去噪结果不会写入持久状态。该“干净提交”规则保持了串行记忆转移语义,因此阶段并行无需专门重训。


阿里22B模型实现实时分钟级稳定数字人生成,自定义角色流式交互模型开源

记忆感知的阶段并行推理。只有最终阶段的干净输出更新跨窗口记忆。


实验结果


论文在中英文、固定镜头、单人场景上构建长时评测。内部方法生成60秒、768×512、24 FPS的视频,每个案例由按时间排序的多段提示词驱动,动作和台词持续变化,人物、场景、镜头与声音描述保持一致。


在该基准上,TaoMate取得5.918的LipSync、0.000的Desync、0.9755的Long Consistency和0.00260的Color Δ。相较各指标最强外部结果,LipSync提升9.7%,Long Consistency提高0.0136,Color Δ降低51.9%。其DiT吞吐为16.32 FPS,是次高测量结果的1.56倍。需要区分的是,DiT FPS不包含数据读取、VAE解码和后处理;3卡阶段并行报告的是完整生成流水线,达到35.0 FPS,超过24 FPS播放速率45.8%。单卡完整流水线为11.1 FPS


阿里22B模型实现实时分钟级稳定数字人生成,自定义角色流式交互模型开源

一分钟定性对比。列为不同时间点,行为不同生成方法。


除统一的60秒量化基准外,项目主页还展示了5至6分钟连续生成和30分钟不间断案例,用于观察更长时段的外观、场景与音画稳定性。相关演示不与论文基准指标混用。


从长视频生成到实时交互:数字人开始“在线对话”


长视频稳定只是底层能力,最终还要进入可操作的交互链路。团队进一步搭建了实时交互网站原型:用户可选择家庭讲解员、科技主持人、商务顾问、课程讲师或健康顾问等预设角色,配置横竖屏比例与场景描述,输入对话文本后启动会话。录屏界面同步呈现缓冲、思考、直播与回放状态,展示了从提示词配置、音视频生成到流式播放的完整闭环。


阿里22B模型实现实时分钟级稳定数字人生成,自定义角色流式交互模型开源

交互式网站录屏。用户选择角色并输入文本后,系统以流式方式返回实时数字人视频。


该演示体现了TaoMate在产品形态上的意义:22.1B生成器不仅能够连续生成长视频,还可在多轮交互中借助跨窗口记忆维持人物外观与场景条件,并以实时流水线支撑边生成边播放。


阿里22B模型实现实时分钟级稳定数字人生成,自定义角色流式交互模型开源


阿里22B模型实现实时分钟级稳定数字人生成,自定义角色流式交互模型开源

TaoMate实时生成人物一致长视频


项目价值


TaoMate的价值在于同时处理长时一致性、音画同步与实时推理,而不是单独优化其中一项。固定容量记忆为直播数字人、虚拟讲解员和持续交互角色提供了时长无关的条件机制;锚点约束更新降低了递归误差扩散风险;阶段并行则将22.1B生成器推进到实时完整流水线。


当前评测仍集中于中英文单人场景,复杂镜头运动、多人交互和任意时长的细粒度事件记忆有待进一步研究。实际部署还应取得身份与数据授权,披露合成媒体并保留生成来源,防止未经授权的身份复制和误导性使用。


论文题目为:TaoMate: Anchor-Guided Memory Bridging Evolving and Reference States for Real-Time Audio-Video Digital Human Generation
论文作者:Qijun Gan、Chenwei Zhang、Meiguang Jin、Junfeng Ma和Qiu Shen
研究单位:阿里巴巴淘天集团与南京大学
论文:https://arxiv.org/abs/2607.24359
项目主页:https://taoliveaigc.github.io/TaoMate/
GitHub:https://github.com/TaoLiveAIGC/TaoMate
Hugging Face:https://huggingface.co/TaoLiveAIGC/TaoMate


文章来自于"量子位",作者 "TaoMate团队"。

AI转型,免费服务,就找AITNT
AITNT资源拓展
根据文章内容,系统为您匹配了更有价值的资源信息。内容由AI生成,仅供参考
1
数字人

【开源免费】Fay开源数字人框架是一个AI数字人项目,该项目可以帮你实现“线上线下的数字人销售员”,

“一个人机交互的数字人助理”或者是一个一个可以自主决策、主动联系管理员的智能体数字人。

项目地址:https://github.com/xszyou/Fay

2
prompt

【开源免费】LangGPT 是一个通过结构化和模板化的方法,编写高质量的AI提示词的开源项目。它可以让任何非专业的用户轻松创建高水平的提示词,进而高质量的帮助用户通过AI解决问题。

项目地址:https://github.com/langgptai/LangGPT/blob/main/README_zh.md

在线使用:https://kimi.moonshot.cn/kimiplus/conpg00t7lagbbsfqkq0

3
无人直播

【开源免费】VideoChat是一个开源数字人实时对话,该项目支持支持语音输入和实时对话,数字人形象可自定义等功能,首次对话延迟低至3s。

项目地址:https://github.com/Henry-23/VideoChat

在线体验:https://www.modelscope.cn/studios/AI-ModelScope/video_chat


【开源免费】Streamer-Sales 销冠是一个AI直播卖货大模型。该模型具备AI生成直播文案,生成数字人形象进行直播,并通过RAG技术对现有数据进行寻找后实时回答用户问题等AI直播卖货的所有功能。

项目地址:https://github.com/PeterH0323/Streamer-Sales