随着 Sora、Runway 等视频生成模型的快速迭代,AI 视频生成正在变得越来越普及。但生成速度慢、算力门槛高的问题,让大多数开发者和创作者难以将其落地。一段 5 秒 720P 视频,传统方法需要超过 1 小时才能完成扩散生成——这给实时创作、批量生成与消费级硬件部署带来了巨大挑战。
更令人困惑的是,当研究者试图通过极致稀疏化(97%稀疏率)来突破性能瓶颈时,却发现了一个反常现象:训练损失持续下降,生成视频质量却急剧恶化——人物破碎、背景扭曲、时序混乱。
针对这一问题,北京大学、清华大学、阿里巴巴等机构的研究者提出了 SparkDiffusion:首个将稀疏注意力、少步蒸馏与低精度量化整合到统一框架(含开源权重及完整训练代码)的视频生成加速系统,推动 DiT 视频生成从「分散优化单个组件」转向「端到端系统化加速」的新范式。
核心发现
"高稀疏陷阱"——当训练越久,质量越差
极致稀疏的反常现象
研究团队发现,当稀疏率从 90%推到 97%时(计算量从 10%降至 3%),训练损失持续下降,生成视频却开始破碎、扭曲、失去时序连贯性。更诡异的是,延长训练、增大数据集、扩大补偿分支容量,都无法修复这个问题。

团队将这种现象命名为"高稀疏陷阱"(High-Sparsity Trap):
在极高稀疏率下,逐步监督架构的稀疏视频 DiT 会陷入一种失效模式——尽管单步验证损失持续优化,但终端生成质量却停滞不前甚至退化,而且延长逐步训练也无法实质性恢复终端质量。
问题出在哪?误差累积在高噪声阶段
扩散模型沿着去噪轨迹逐步生成视频。传统的 Flow Matching 等逐步监督方法,只要求模型在某个噪声时刻预测正确的速度,却不直接约束"这一步与后续轨迹组合后,最终会生成什么"。
关键实验:Oracle 干预
研究者做了一项 Oracle 干预实验:在 97%稀疏率下,用稠密教师的预测替换稀疏学生在不同采样区间的预测。

发现:
结论: 高噪声阶段的结构误差会被后续步骤放大,最终导致终端质量崩溃。
解法
从诊断到分阶段治疗
核心洞察:终端对齐监督
传统方法的问题: 只监督"当前这一步预测是否准确",却不管后续累积误差会把结果带偏到哪里。
SparkDiffusion 的解法: 终端对齐监督(Terminal-Aligned Supervision),在训练时就约束"这一步最终会生成什么",从根源上避免误差累积。
理论验证:二维序列分布实验

在六种二维序列分布上:
方法设计
RoLA + CrossDistill + FP8
分阶段策略:先适应,再修正
基于上述诊断,SparkDiffusion 提出三阶段流程:

RoLA:为极高稀疏率保留全局信息
SparkDiffusion 默认采用团队提出的 RoLA:Rotary-Positioned Low-Rank Linear Attention for Efficient Diffusion Transformers 作为稀疏注意力模块。RoLA 一边通过块稀疏分支保留高能量 query-key 交互,一边用带旋转位置信息的低秩线性分支补回被稀疏化舍弃的全局上下文。
CrossDistill:3 步兼顾质量与多样性
SparkDiffusion 的少步蒸馏采用团队提出的 CrossDistill:Balancing Quality and Diversity via Trajectory-Level Hybrid Few-Step Distillation。CrossDistill 在噪声轨迹上设置交叉点。PCM 一致性目标和 DMD 分布匹配目标都不是只拟合孤立时刻,而是利用后续轨迹或最终输出构造监督,因此都属于终端对齐监督:
最终得到一个 3 步、无 CFG 的学生模型。它一方面用终端对齐信号跨过高稀疏陷阱,另一方面通过高低噪声分工平衡生成质量与多样性。
再结合 FP8 量化策略以及团队开发的高性能融合算子,将理论计算收益转化为实际延迟缩减。
实验结果
单卡 RTX 5090 实现 265 倍加速
主要性能数据

SparkDiffusion 在以下配置下均保持高质量快速生成:
为什么高分辨率加速更明显?
分辨率越高,稀疏收益越大:
这解释了为什么 720P-14B 的 265×加速比 480P-1.3B 的 140×更高。

立即体验
SparkDiffusion 已完整开源:
✅ 权重
✅ 稀疏微调+蒸馏训练代码
✅ RTX 5090/H100 推理脚本
✅ 统一加速框架 (稀疏+蒸馏+量化一体化)
✅ 跨模型支持 (Wan2.1/Wan2.2, T2V/I2V, 480P/720P)

总结与展望
SparkDiffusion 将 DiT 视频生成加速从"分散优化单个组件"推进到"端到端系统化加速":
核心贡献:
实测成果:
研究团队希望这项工作能够为视频生成落地提供新的思路,在高稀疏度下激发消费级显卡视频生成的速度上限,让消费级显卡也能高质量生成视频。
下一步计划
团队正在将该框架扩展至:
AR 扩展、全模态生成的后续进展,敬请期待。
文章来自于微信公众号 “机器之心”,作者 “机器之心”