ARTICLE SIGNAL

何恺明参与DeepMind颠覆性视觉基座,数据仅1/500

何恺明, DeepMind, GenCeption, 文生视频, 通用视觉基座, AI, AI资讯, AI新闻, 大模型, 人工智能, 探讨利用1/500训练数据将文生视频模型打造为通用视觉基座,打破视觉任务内卷,展现强大泛化能力。

type
status
date
slug
summary
tags
category
icon
password
网址
「一套文生视频搞定八大视觉任务」
当下计算机视觉长期陷入“一任务一专用模型”内卷:
做深度估计要用DepthAnything,分割依赖SAM,人体姿态单独训练Sapiens,几何重建还得搭VGGT,各类网络骨干、解码器、损失函数完全割裂,研发与部署成本居高不下。
DeepMind联合多所高校推出GenCeption给出颠覆性解法:
不用从零训练感知网络,直接复用预训练文生视频扩散模型作为通用预训练基座,仅靠单套前向架构,通过文本指令切换深度、法向量、分割、3D关键点、相机位姿等十几种视觉任务,在主流基准上持平甚至超越各类专业定制模型,训练所需数据量仅为竞品1/7至1/500,还诞生仿真泛化到真实动物、多实例识别等涌现能力。
这套方案打通视频生成与通用视觉感知的边界,证明文生视频预训练是计算机视觉领域对标NLP下一个token预测的通用预训练路径。
1
GenCeption统一架构
整套框架不改动预训练DiT扩散主干核心权重,仅通过后训练适配多感知任务,整体分为预训练基座、统一多任务表征、稀疏任务令牌三大核心模块,全程统一骨干、统一解码器、单一L2损失,任务差异仅靠文本prompt与输出格式区分,无需为每个任务定制网络头。
图 | GenCeption架构总览图 ©【深蓝AI】编译
1.1 预训练文生视频DiT主干复用
GenCeption选用WAN 2.1预训练文生扩散模型作为基座,摒弃扩散模型多步迭代去噪流程,将输入固定为无噪声原始视频隐变量,时间步强制设定t=0(整流流推理终止条件),模型输出取负速度向量对齐真实视觉目标隐空间,仅保留单次前向推理,把生成器改造为特征提取器。
训练不改动主干基础表征,仅微调少量适配层,最大限度保留预训练学到的时空、图文先验,这也是它数据效率远超MAE、V-JEPA的核心原因。
图 |GenCeption完整架构总览图 ©【深蓝AI】编译
1.2 稠密视觉任务:统一RGB像素表征方案
针对深度、表面法向量、前景分割、稠密人体姿态、射线图这类像素级稠密任务,论文提出统一3通道RGB输出规范,所有任务预测结果全部映射至[0,1]RGB值域:
单通道量(深度)复制三通道填充;三维法向量直接使用RGB三通道存储;相机6维射线数据设计“罗斯科射线图”格式,旋转信息放左上区域、平移信息放中心绿色区块,在不修改解码器结构前提下兼容高维几何输出。
整套设计类比大语言模型把各类任务转化为文本字符串,视觉领域将所有稠密感知统一为像素图像,一套VAE编码器、解码器即可完成全部稠密任务输入输出,无需多分支解码网络。
图 | “罗斯科”射线图格式示意图 ©【深蓝AI】编译
1.3 稀疏视觉任务:可学习令牌扩展模块
2D/3D人体关键点这类离散坐标输出无法融入像素表征,框架新增一组可学习时序令牌,拼接至视频隐序列后送入DiT主干,推理完成后通过单层MLP解码得到每帧关键点坐标;时序位置采用插值缩放适配预训练时间窗口,不破坏主干原生3D RoPE位置编码,稠密、稀疏任务共享同一套主干权重,仅依靠文本指令区分输出类型。
1.4 统一单损失训练机制
现有多任务视觉方案普遍存在损失平衡难题,深度、分割、关键点损失量级差异巨大,需要人工调试数十组权重。GenCeption完全舍弃多损失组合,所有稠密、稀疏任务统一使用L2损失:
深度图通过场景中位数归一化+对数压缩映射至标准值域,消除尺度歧义;分割、姿态等原生像素任务直接在隐空间计算损失;稀疏关键点在输出坐标空间计算误差。任务权重不再靠损失系数调节,仅依靠训练时混合数据比例控制,大幅降低多任务调参成本。
图 |深度与表面法线估计定性效果展示图 ©【深蓝AI】编译
2
全合成视频完成通用视觉训练
GenCeption整套后训练不使用任何真实标注视频,仅依托Blender生成以人为核心的7500条合成视频数据集:
素材采用800组数字人资产、200套CMU动作捕捉序列,搭配多样化HDRI背景、可变相机焦距生成训练素材,渲染同步输出深度、法线、分割掩码、人体关节真值,每条视频附带对应文本指令。
图 |文本指代分割定性结果图 ©【深蓝AI】编译
数据集仅包含人类相关仿真素材,但模型训练完成后具备极强跨类别泛化,也就是论文重点提出的涌现行为,这也是文生视频预训练表征强大的直观佐证。
3
实验结果
实验分为多任务综合对标、不同预训练范式对比、数据缩放规律、涌现能力四大板块,区分纸面指标与工程实际价值,同时标注各类指标适用边界,避免单纯刷榜式解读。
3.1 多任务横向对标
测试覆盖深度、表面法线、相机位姿、前景抠图、文本指代分割、3D人体关键点六大任务,对比DepthAnything3、SAM3、VGGT-Ω、Sapiens、Genmo等行业标杆模型。
核心结论:GenCeption通用单模型在绝大多数基准达到对标效果,专用微调版(单一任务训练)小幅领先通用版;但要客观看待指标局限:所有几何、分割测试基准场景结构规整,无极端强光、遮挡、动态杂乱真实环境,在杂乱野外、复杂室内场景精度会出现明显回落。
表 | GenCeption与主流专用SOTA模型全任务定量对比表 ©【深蓝AI】编译
对比优势来源并非模型算力更强,而是文生预训练自带时序一致性,视频序列预测不会出现帧间闪烁,这是单图像专用模型普遍缺失的能力。
3.2 不同预训练范式公平对比
在同等微调数据规模下,WAN 2.1文生预训练主干(GenCeption基底)全面超越V-JEPA、VideoMAE V2两种主流视频自监督方案,模型尺寸放大、训练数据增加时性能持续稳步提升,展现清晰缩放定律。
表 | 各类预训练主干深度任务定量对比表 ©【深蓝AI】编译
数据效率是该工作最大工程亮点:达到VGGT-Ω同等深度精度,仅需其1/500训练帧;对标D4RT仅需1/7数据。
3.3 消融实验:预训练层数量验证
消融实验清晰证明预训练主干不可替代:
完全随机初始化DiT(0层预训练)损失几乎不下降;随冻结预训练层数增加,收敛速度、最终精度同步提升,40层完整复用预训练权重达到最优效果,直接证实文生视频预训练存储的时空、图文先验是模型性能核心来源。
图 |不同预训练冻结层数训练损失收敛曲线 ©【深蓝AI】编译
3.4 两大关键涌现行为(行业突破性发现)
1.仿真到真实零迁移:仅在合成数字人视频训练,直接适配真实人类实拍视频,细节纹理、边缘分割效果优于专用仿真迁移模型;
2.跨类别零样本泛化:训练集完全无动物、人形机器人素材,输入动物视频+对应文本指令,可精准输出深度、分割、3D关键点,证明预训练学到通用物体运动、几何底层规律,而非人类专属特征;
图 |多实例与人外类别泛化效果图 ©【深蓝AI】编译
补充局限:泛化仅针对基础几何分割任务,稀有生物、复杂铰接物体精度会明显下滑,无法完全替代专用动物感知模型。
4
行业启发与总结
NLP依靠next-token生成预训练实现大一统大模型,计算机视觉此前始终找不到对等通用预训练目标,GenCeption给出清晰答案:大规模文生视频扩散模型是视觉领域通用预训练最优载体。
该工作并非单纯刷新各项benchmark,而是重构视觉模型开发流程:放弃“一任务一专用网络”老路,把视频生成沉淀的时空、图文先验作为公共底座,依靠统一像素表征、文本指令调度实现多任务兼容,同时依靠合成数据解决标注稀缺痛点。
从行业路线划分,未来视觉模型会分化两条路径:一是单任务极致精度专用模型(高端工业检测、高精度测绘);二是GenCeption这类多任务通用基座(机器人、多媒体、低成本感知设备),二者不存在完全替代关系,而是互补选型。
同时也要客观看待该范式的发展阶段:目前仅在静态仿真、常规真实视频验证,复杂动态、极端恶劣环境适配仍有较大优化空间,后续若融合视觉编码器、轻量化蒸馏,会进一步拓宽嵌入式落地场景。
Ref
论文标题:Video Generation Models are General-Purpose Vision Learners
论文链接:https://arxiv.org/pdf/2607.09024
项目主页:https://genception.github.io
文章来自于"深蓝AI",作者 "深蓝学院"。
Loading...

没有找到文章