何恺明参与!DeepMind把文生视频模型做成通用视觉基座,训练数据量仅1/500

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
何恺明参与!DeepMind把文生视频模型做成通用视觉基座,训练数据量仅1/500
8170点击    2026-08-07 09:10

何恺明参与!DeepMind把文生视频模型做成通用视觉基座,训练数据量仅1/500

一套文生视频搞定八大视觉任务


当下计算机视觉长期陷入“一任务一专用模型”内卷:


做深度估计要用DepthAnything,分割依赖SAM,人体姿态单独训练Sapiens,几何重建还得搭VGGT,各类网络骨干、解码器、损失函数完全割裂,研发与部署成本居高不下。


DeepMind联合多所高校推出GenCeption给出颠覆性解法:


不用从零训练感知网络,直接复用预训练文生视频扩散模型作为通用预训练基座,仅靠单套前向架构,通过文本指令切换深度、法向量、分割、3D关键点、相机位姿等十几种视觉任务,在主流基准上持平甚至超越各类专业定制模型,训练所需数据量仅为竞品1/7至1/500,还诞生仿真泛化到真实动物、多实例识别等涌现能力。


这套方案打通视频生成与通用视觉感知的边界,证明文生视频预训练是计算机视觉领域对标NLP下一个token预测的通用预训练路径。


何恺明参与!DeepMind把文生视频模型做成通用视觉基座,训练数据量仅1/500


1

GenCeption统一架构


整套框架不改动预训练DiT扩散主干核心权重,仅通过后训练适配多感知任务,整体分为预训练基座、统一多任务表征、稀疏任务令牌三大核心模块,全程统一骨干、统一解码器、单一L2损失,任务差异仅靠文本prompt与输出格式区分,无需为每个任务定制网络头。


何恺明参与!DeepMind把文生视频模型做成通用视觉基座,训练数据量仅1/500

图 | GenCeption架构总览图 ©【深蓝AI】编译


1.1 预训练文生视频DiT主干复用


GenCeption选用WAN 2.1预训练文生扩散模型作为基座,摒弃扩散模型多步迭代去噪流程,将输入固定为无噪声原始视频隐变量,时间步强制设定t=0(整流流推理终止条件),模型输出取负速度向量对齐真实视觉目标隐空间,仅保留单次前向推理,把生成器改造为特征提取器。


训练不改动主干基础表征,仅微调少量适配层,最大限度保留预训练学到的时空、图文先验,这也是它数据效率远超MAE、V-JEPA的核心原因。


何恺明参与!DeepMind把文生视频模型做成通用视觉基座,训练数据量仅1/500

图 |GenCeption完整架构总览图 ©【深蓝AI】编译


1.2 稠密视觉任务:统一RGB像素表征方案


针对深度、表面法向量、前景分割、稠密人体姿态、射线图这类像素级稠密任务,论文提出统一3通道RGB输出规范,所有任务预测结果全部映射至[0,1]RGB值域:


单通道量(深度)复制三通道填充;三维法向量直接使用RGB三通道存储;相机6维射线数据设计“罗斯科射线图”格式,旋转信息放左上区域、平移信息放中心绿色区块,在不修改解码器结构前提下兼容高维几何输出。


整套设计类比大语言模型把各类任务转化为文本字符串,视觉领域将所有稠密感知统一为像素图像,一套VAE编码器、解码器即可完成全部稠密任务输入输出,无需多分支解码网络。


何恺明参与!DeepMind把文生视频模型做成通用视觉基座,训练数据量仅1/500

图 | “罗斯科”射线图格式示意图 ©【深蓝AI】编译


1.3 稀疏视觉任务:可学习令牌扩展模块


2D/3D人体关键点这类离散坐标输出无法融入像素表征,框架新增一组可学习时序令牌,拼接至视频隐序列后送入DiT主干,推理完成后通过单层MLP解码得到每帧关键点坐标;时序位置采用插值缩放适配预训练时间窗口,不破坏主干原生3D RoPE位置编码,稠密、稀疏任务共享同一套主干权重,仅依靠文本指令区分输出类型。


1.4 统一单损失训练机制


现有多任务视觉方案普遍存在损失平衡难题,深度、分割、关键点损失量级差异巨大,需要人工调试数十组权重。GenCeption完全舍弃多损失组合,所有稠密、稀疏任务统一使用L2损失:


深度图通过场景中位数归一化+对数压缩映射至标准值域,消除尺度歧义;分割、姿态等原生像素任务直接在隐空间计算损失;稀疏关键点在输出坐标空间计算误差。任务权重不再靠损失系数调节,仅依靠训练时混合数据比例控制,大幅降低多任务调参成本。


何恺明参与!DeepMind把文生视频模型做成通用视觉基座,训练数据量仅1/500

图 |深度与表面法线估计定性效果展示图 ©【深蓝AI】编译


2

全合成视频完成通用视觉训练


GenCeption整套后训练不使用任何真实标注视频,仅依托Blender生成以人为核心的7500条合成视频数据集:


素材采用800组数字人资产、200套CMU动作捕捉序列,搭配多样化HDRI背景、可变相机焦距生成训练素材,渲染同步输出深度、法线、分割掩码、人体关节真值,每条视频附带对应文本指令。


何恺明参与!DeepMind把文生视频模型做成通用视觉基座,训练数据量仅1/500

图 |文本指代分割定性结果图 ©【深蓝AI】编译


数据集仅包含人类相关仿真素材,但模型训练完成后具备极强跨类别泛化,也就是论文重点提出的涌现行为,这也是文生视频预训练表征强大的直观佐证。


3

实验结果


实验分为多任务综合对标、不同预训练范式对比、数据缩放规律、涌现能力四大板块,区分纸面指标与工程实际价值,同时标注各类指标适用边界,避免单纯刷榜式解读。


3.1 多任务横向对标


测试覆盖深度、表面法线、相机位姿、前景抠图、文本指代分割、3D人体关键点六大任务,对比DepthAnything3、SAM3、VGGT-Ω、Sapiens、Genmo等行业标杆模型。


核心结论:GenCeption通用单模型在绝大多数基准达到对标效果,专用微调版(单一任务训练)小幅领先通用版;但要客观看待指标局限:所有几何、分割测试基准场景结构规整,无极端强光、遮挡、动态杂乱真实环境,在杂乱野外、复杂室内场景精度会出现明显回落。


何恺明参与!DeepMind把文生视频模型做成通用视觉基座,训练数据量仅1/500

表 | GenCeption与主流专用SOTA模型全任务定量对比表 ©【深蓝AI】编译


对比优势来源并非模型算力更强,而是文生预训练自带时序一致性,视频序列预测不会出现帧间闪烁,这是单图像专用模型普遍缺失的能力。


3.2 不同预训练范式公平对比


在同等微调数据规模下,WAN 2.1文生预训练主干(GenCeption基底)全面超越V-JEPA、VideoMAE V2两种主流视频自监督方案,模型尺寸放大、训练数据增加时性能持续稳步提升,展现清晰缩放定律。


何恺明参与!DeepMind把文生视频模型做成通用视觉基座,训练数据量仅1/500

表 | 各类预训练主干深度任务定量对比表 ©【深蓝AI】编译


数据效率是该工作最大工程亮点:达到VGGT-Ω同等深度精度,仅需其1/500训练帧;对标D4RT仅需1/7数据。


3.3 消融实验:预训练层数量验证


消融实验清晰证明预训练主干不可替代:


完全随机初始化DiT(0层预训练)损失几乎不下降;随冻结预训练层数增加,收敛速度、最终精度同步提升,40层完整复用预训练权重达到最优效果,直接证实文生视频预训练存储的时空、图文先验是模型性能核心来源。


何恺明参与!DeepMind把文生视频模型做成通用视觉基座,训练数据量仅1/500

图 |不同预训练冻结层数训练损失收敛曲线 ©【深蓝AI】编译


3.4 两大关键涌现行为(行业突破性发现)


1. 仿真到真实零迁移:仅在合成数字人视频训练,直接适配真实人类实拍视频,细节纹理、边缘分割效果优于专用仿真迁移模型;


2. 跨类别零样本泛化:训练集完全无动物、人形机器人素材,输入动物视频+对应文本指令,可精准输出深度、分割、3D关键点,证明预训练学到通用物体运动、几何底层规律,而非人类专属特征;


何恺明参与!DeepMind把文生视频模型做成通用视觉基座,训练数据量仅1/500

图 | 多实例与人外类别泛化效果图 ©【深蓝AI】编译


补充局限:泛化仅针对基础几何分割任务,稀有生物、复杂铰接物体精度会明显下滑,无法完全替代专用动物感知模型。


4

行业启发与总结


NLP依靠next-token生成预训练实现大一统大模型,计算机视觉此前始终找不到对等通用预训练目标,GenCeption给出清晰答案:大规模文生视频扩散模型是视觉领域通用预训练最优载体。


该工作并非单纯刷新各项benchmark,而是重构视觉模型开发流程:放弃“一任务一专用网络”老路,把视频生成沉淀的时空、图文先验作为公共底座,依靠统一像素表征、文本指令调度实现多任务兼容,同时依靠合成数据解决标注稀缺痛点。


从行业路线划分,未来视觉模型会分化两条路径:一是单任务极致精度专用模型(高端工业检测、高精度测绘);二是GenCeption这类多任务通用基座(机器人、多媒体、低成本感知设备),二者不存在完全替代关系,而是互补选型。


同时也要客观看待该范式的发展阶段:目前仅在静态仿真、常规真实视频验证,复杂动态、极端恶劣环境适配仍有较大优化空间,后续若融合视觉编码器、轻量化蒸馏,会进一步拓宽嵌入式落地场景。


Ref


论文标题:Video Generation Models are General-Purpose Vision Learners 


论文链接:https://arxiv.org/pdf/2607.09024


项目主页:https://genception.github.io


文章来自于"深蓝AI",作者 "深蓝学院"。

AI转型,免费服务,就找AITNT
AITNT资源拓展
根据文章内容,系统为您匹配了更有价值的资源信息。内容由AI生成,仅供参考
1
数字人

【开源免费】Fay开源数字人框架是一个AI数字人项目,该项目可以帮你实现“线上线下的数字人销售员”,

“一个人机交互的数字人助理”或者是一个一个可以自主决策、主动联系管理员的智能体数字人。

项目地址:https://github.com/xszyou/Fay

2
RAG

【开源免费】graphrag是微软推出的RAG项目,与传统的通过 RAG 方法使用向量相似性作为搜索技术不同,GraphRAG是使用知识图谱在推理复杂信息时大幅提高问答性能。

项目地址:https://github.com/microsoft/graphrag

【开源免费】Dify是最早一批实现RAG,Agent,模型管理等一站式AI开发的工具平台,并且项目方一直持续维护。其中在任务编排方面相对领先对手,可以帮助研发实现像字节扣子那样的功能。

项目地址:https://github.com/langgenius/dify


【开源免费】RAGFlow是和Dify类似的开源项目,该项目在大文件解析方面做的更出色,拓展编排方面相对弱一些。

项目地址:https://github.com/infiniflow/ragflow/tree/main


【开源免费】phidata是一个可以实现将数据转化成向量存储,并通过AI实现RAG功能的项目

项目地址:https://github.com/phidatahq/phidata


【开源免费】TaskingAI 是一个提供RAG,Agent,大模型管理等AI项目开发的工具平台,比LangChain更强大的中间件AI平台工具。

项目地址:https://github.com/TaskingAI/TaskingAI

3
微调

【开源免费】XTuner 是一个高效、灵活、全能的轻量化大模型微调工具库。它帮助开发者提供一个简单易用的平台,可以对大语言模型(LLM)和多模态图文模型(VLM)进行预训练和轻量级微调。XTuner 支持多种微调算法,如 QLoRA、LoRA 和全量参数微调。

项目地址:https://github.com/InternLM/xtuner

4
prompt

【开源免费】LangGPT 是一个通过结构化和模板化的方法,编写高质量的AI提示词的开源项目。它可以让任何非专业的用户轻松创建高水平的提示词,进而高质量的帮助用户通过AI解决问题。

项目地址:https://github.com/langgptai/LangGPT/blob/main/README_zh.md

在线使用:https://kimi.moonshot.cn/kimiplus/conpg00t7lagbbsfqkq0

5
无人直播

【开源免费】VideoChat是一个开源数字人实时对话,该项目支持支持语音输入和实时对话,数字人形象可自定义等功能,首次对话延迟低至3s。

项目地址:https://github.com/Henry-23/VideoChat

在线体验:https://www.modelscope.cn/studios/AI-ModelScope/video_chat


【开源免费】Streamer-Sales 销冠是一个AI直播卖货大模型。该模型具备AI生成直播文案,生成数字人形象进行直播,并通过RAG技术对现有数据进行寻找后实时回答用户问题等AI直播卖货的所有功能。

项目地址:https://github.com/PeterH0323/Streamer-Sales