【arXiv 2026】GenCeption:视频生成模型是通用视觉学习者|从生成式视觉预训练范式视角
2026/8/24 1:47:56 网站建设 项目流程

摘要

本文解读 arXiv 2026 论文《Video Generation Models are General-Purpose Vision Learners》。该论文提出GenCeption,把大规模文生视频扩散模型改造为单步前馈的通用视觉感知模型,通过统一 RGB 表示可学习 token统一 $L_2$ 损失,让 8 类稠密/稀疏任务共用一个骨干与解码器,其特别之处在于仅用纯合成视频数据训练,即全面超越各任务专用 SOTA。实验表明法向 Hi4D mAE 10.99、深度 Goliath AbsRel 0.008、指代分割 MeViS J&F 70.0,且数据效率达 $7\times$-$500\times$,为计算机视觉的生成式预训练范式提供了系统性证据。

视频讲解:点击观看 B 站视频

  • 摘要
  • 论文基本信息
  • 背景与动机
  • 研究主线:从问题到结论
  • 基准/方法设计
  • 分类全景
  • 方法细节
  • 实验设计与结果
  • 结果对比总结
  • 关键发现
  • 局限性
  • 常见问题(FAQ)
    • GenCeption 和 Vision Banana 有什么区别?
    • 为什么视频生成预训练比 CLIP、MAE 更好?
    • 相机位姿怎么编码进 RGB 图像?
    • GenCeption 训练数据量有多大?
    • 为什么联合训练会损害 3D 关键点?
    • GenCeption 开源吗?
  • 参考链接

论文基本信息

项目内容
标题(英文)Video Generation Models are General-Purpose Vision Learners
标题(中文)视频生成模型是通用视觉学习者
作者Letian Wang, Chuhan Zhang, Rishabh Kabra, Jasper Uijlings, Steven Waslander, Andrew Zisserman, Joao Carreira, Kaiming He, Misha Andriluka, Eduard Gabriel Bazavan, Andrei Zanfir, Cristian Sminchisescu
机构Google DeepMind · U. Toronto · UCL · Oxford · MIT · Lund
会议arXiv 2026
arXivhttps://arxiv.org/abs/2607.09024
项目网站https://genception.github.io

背景与动机

NLP 靠 next-token prediction 从任务专用模型收敛为通用基础模型;计算机视觉却仍停留在"专用模型"阶段——SAM 系列管分割、Depth Anything 系列管深度,每个任务都要定制架构。作者提出,通用视觉预训练需满足三条准则:时空演化(内化 4D 因果与物理)、视觉-语言对齐(原生继承指令跟随)、可规模化(数据与算力可扩展)。

现有工作各有短板:MAE/VideoMAE、DINO 等自监督表征缺少显式多模态对齐;CLIP/SigLIP 对齐了图文却难做视频级表征且规模受限;扩散复用路线(MarigoldGenPerceptDiception)多为单图单任务且依赖多步采样;视频侧DepthCrafter/NormalCrafter聚焦单一稠密任务;同期工作Vision Banana只覆盖二维图像空间。GenCeption 的关键差异是:原生视频域 + 单步前馈 + 稠密/稀疏任务统一,在标准 benchmark 上全面超越专用 SOTA。

研究主线:从问题到结论

图 12:GenCeption 研究主线——从"视频生成"到"通用感知"(Mermaid 流程图)

基准/方法设计

GenCeption 的方法论由三条原则驱动:

  1. 多模态生成预训练即表征学习——文生视频扩散模型作通用骨干,生成高保真视频强制内化时空先验、3D 几何与物理规律,同时原生对齐视觉语言概念;为保留先验,最大化兼容原预训练范式、最小化改动。
  2. 任务无关的统一后训练——把感知任务视为统一的序列到序列映射,稠密任务输出编码进标准 RGB 空间($[0,1]$),文本提示切换任务,单骨干单解码器单损失。
  3. 前馈重构——把多步迭代采样改造成单步确定性预测,兼顾精度与效率。

图 1:方法总览——视频生成模型作预训练基座(左),多任务后训练为前馈感知模型;右图为从专用模型到通用模型的范式转移

分类全景

图 13:GenCeption 任务分类——稠密任务统一进 RGB 空间,稀疏任务由可学习 token 承载(Mermaid 流程图)

方法细节

前馈重构:干净视频潜在 $x_0$ 直接输入 DiT,时间步固定 $t=0$(Rectified Flow 终止点);DiT 输出速度 $v = \epsilon - x_0$,取负后 $-v = x_0 - \epsilon$ 更接近目标潜在,加速收敛。本质是把 DiT 重铸为特征提取器,特征直接取自最后一层,与解码器原生对齐。

稠密任务统一到 RGB:深度/分割单通道复制为三通道,法向/DensePose 天然三维;相机位姿以像素级 raymap 表示(6 通道),通过空间分区——中心放射线原点、四周放射线方向——压缩进 3 通道,保持单解码器框架。

稀疏任务用可学习 token:每帧追加一个可学习 query token,经 MLP 解码为 $K$ 维坐标;沿用原生 3D RoPE(空间位置可学习),时间位置用插值压缩到预训练所见范围,优于额外注意力层方案。

数据级消歧:深度按场景中值归一化,再用非线性映射 $d' = \mathrm{clip}(\alpha \log(d+1), 0, 1)$ 压到 RGB 范围,彻底免去 scale-invariant 等专用损失——任务差异化全部下沉到数据表示。

合成数据管线:800 个 RenderPeople 模型 × 200 段 CMU 动作,Blender 多渲染通道生成 7,500 段视频,同时产出法向、深度、分割、2D/3D 关键点真值;离线预计算视频/文本潜在加速训练。训练补充 TartanAir、Virtual KITTI、MVS Synth(深度),指代分割用 MeViS/Ref-COCO/YouTube-VOS 真实数据。

图 2:架构总览——输入视频 + 文本提示,一次前向输出目标模态;稠密任务在 RGB 潜在空间监督,稀疏任务由可学习 token 承载

图 3:"Rothko" Raymap——把相机位姿的六通道射线数据压缩进标准 3 通道 RGB

训练配置:WAN 2.1 基座(1.3B/14B),480×832 分辨率、81 帧 @24fps;batch 64 × 256 v6e TPU,Adam lr $5e^{-5}$,15,000 步,250 步 warmup;gradient clipping + gradient dropping 保证稳定。

实验设计与结果

评测协议:法向用 Hi4D(Sapiens/DAVID 协议,1,195 帧)与 SINTEL;深度用 KITTI/SINTEL/ETH3D/Goliath(DAVID 子集 2.2k 帧);相机位姿用 SINTEL(ATE/RPE-T/RPE-R);前景分割用 VideoMatte/PhotoMatte 85/PPM-100(MSE);指代分割用 RefVOS-DAVIS 与 MeViS(J&F);3D 关键点用 EMDB(MPJPE)。除指代分割外全部纯合成数据训练,未使用任何评测集训练数据。

与专用 SOTA 对比主表

任务(指标↓)最强专用GenCeption L胜出幅度
法向 Hi4D (mAE)Sapiens 12.1410.99-1.15
法向 SINTEL (mAE)Lotus-2 30.329.3-1.0
深度 SINTEL (AbsRel)D4RT 0.1480.130-12%
深度 Goliath (AbsRel)DepthAnything 3 0.0120.008-33%
相机位姿 SINTEL (ATE)VGGT-Ω 0.0570.050-12%
指代分割 MeViS (J&F)ReferEverything 60.370.0+16%
3D 关键点 EMDB (MPJPE)Genmo 73.071.8-1.2
前景分割 VideoMatte (MSE)RVM 0.00100.0010(Generalist)持平

预训练范式与缩放(深度平均 AbsRel)

方法规模训练帧数Avg AbsRel↓
V-JEPA - H0.6B0.9M0.281
VideoMAE V2 - G1B0.9M0.154
Ours - WAN 2.1 - S1.3B0.9M0.122
Ours - WAN 2.1 - L14B0.9M0.093
DepthAnything 3 - G1.15B~200M0.096
D4RT1B~86M0.082
VGGT-Ω1B~600M0.067
Ours - WAN 2.1 - L (4 数据集)14B1.23M0.071

图 4:能力总览——法向、深度、前景分割、指代分割、稠密人体语义、2D/3D 关键点、相机位姿,仅训练于合成人体视频却泛化到动物与卡通角色

图 5:左:通用能力雷达图——匹配或超越各任务专用模型;右:深度估计数据效率——$7\times$-$500\times$ 更少训练数据达到同等性能

图 6:预训练迁移消融——迁移预训练层数越多性能越高,随机初始化 DiT 学习曲线近乎平坦

图 7:深度与表面法向估计定性结果(首帧)

图 8:指代分割定性结果——识别物体、颜色、空间关系与运动,并分割未见类别

图 9:涌现泛化(a)——训练数据单物体,零样本迁移到真实多人场景

图 10:涌现泛化(b)——仅训练人体类别,泛化到猫等未见类别

图 11:3D 姿态估计——滑雪/单板视频(每 10 帧取一帧),无需人体检测或 2D 关键点预处理

推理成本:1.3B 模型 81 帧 480×832 单次前向 5.92s @ 13.6 FPS(DiT 0.96s)、15.3GB 显存;14B 模型 10.03s @ 8.0 FPS(DiT 5.11s)、42.8GB 显存——对比 WAN 2.1 原版 50 步扩散采样,推理成本降低约一个数量级。

结果对比总结

图 14:GenCeption 与各任务专用 SOTA 的对比总结(Mermaid 流程图)

关键发现

  • 生成式预训练范式完胜:同数据同规模下,WAN 2.1 生成式预训练平均 AbsRel 0.093(14B),大幅优于 V-JEPA 的 0.281 与 VideoMAE V2 的 0.154——关键在生成目标本身,而非数据集或规模。
  • 数据效率惊人:14B 模型用 1.23M 帧达到 VGGT-Ω(约 600M 帧)同级水平,即 $7\times$-$500\times$ 更少训练数据;D4RT(约 86M 帧)同样被 1.23M 帧追平。
  • 缩放性质初现:1.3B → 14B、数据翻倍,深度误差单调下降;从零训练 DiT 曲线近乎水平,预训练层数越多收敛越好。
  • 涌现行为显著:纯合成人体视频训练,零样本迁移到真实多人场景与猫、机器人等 OOD 类别,猫胡须等细节甚至超过训练数据画质。
  • 联合训练有代价:前景分割受益于多任务联合训练,但 3D 关键点 MPJPE 明显退化——token 坐标回归偏离像素空间先验,可学习 token 干扰原生注意力。
  • 推理效率数量级提升:14B 单次前向 DiT 5.11s,对比 50 步扩散采样,成本降低约一个数量级。

局限性

  • 稀疏任务退化:联合训练使 3D 关键点明显变差——token 回归与像素空间预训练本质相悖,可学习 token 从零训练破坏预训练注意力。
  • 合成域依赖:训练数据以人体为中心,背景与物体多样性受限;指代分割仍需 MeViS/Ref-COCO/YouTube-VOS 等真实数据补充。
  • 分辨率与显存开销:480×832 输入,14B 模型单次前向需 5.11s 与 42.8GB 显存,虽比 50 步扩散快得多仍非实时。
  • 并发竞争:与 Vision Banana、Wiedemer et al. 等工作同期,范式归属与基准差异需后续检验。
  • 作者展望:后训练应最小化对预训练骨干的架构改动,或从根本上重新设计预训练目标以原生容纳多样化下游任务。

常见问题(FAQ)

GenCeption 和 Vision Banana 有什么区别?

两者同为"生成模型是通用视觉学习者"的同期工作,但 Vision Banana 只覆盖二维图像空间且采用多步生成,GenCeption 扩展到原生视频域、采用单步前馈架构,并在更广泛的任务谱系上做了定量评测。

为什么视频生成预训练比 CLIP、MAE 更好?

因为生成高保真视频强制模型内化时空因果、3D 几何与物理交互,且文本条件生成天然对齐视觉-语言语义;CLIP 等对比方法缺时空建模,MAE 等掩码方法缺模态对齐,且视频表征模型规模普遍小一个量级。

相机位姿怎么编码进 RGB 图像?

采用像素级 raymap:每个像素记录一条射线的原点与方向(共 6 通道),通过空间分区——中心放射线原点、四周放射线方向——压缩进标准 3 通道 RGB,保持单解码器框架不变。

GenCeption 训练数据量有多大?

核心合成数据集 7,500 段视频(800 个 RenderPeople 模型 × 200 段 CMU 动作),深度补充 TartanAir、Virtual KITTI、MVS Synth,指代分割用 MeViS/Ref-COCO/YouTube-VOS;14B 模型全部训练帧约 1.23M,仅为 D4RT 的约 1/70。

为什么联合训练会损害 3D 关键点?

token 式坐标回归偏离连续像素空间预训练,且从零训练的可学习 token 会扰乱预训练 DiT 层的原生注意力机制——说明后训练应最小化对预训练骨干的架构改动。

GenCeption 开源吗?

论文基于开源的开源权重文生视频模型 WAN 2.1,但 GenCeption 本身暂未发布权重与代码;项目页面(genception.github.io)提供更多演示与细节。

参考链接

  • arXiv 论文:https://arxiv.org/abs/2607.09024
  • 项目页面:https://genception.github.io
  • Vision Banana(同期 2D 图像版本):https://arxiv.org/abs/2604.20329
  • Marigold(扩散复用开山之作):https://arxiv.org/abs/2311.17120
  • B 站视频讲解:https://www.bilibili.com/video/BV1n78G65Euk

给大家推荐一款自用写文献综述、无虚构文献的 AI:

🌟复旦大学 FudanNLP 团队自研 切问学术

官网:qiewenpaper.com

覆盖3.6 亿篇可溯源真实中英文文献,能自动整合文献观点生成规范综述

还能挖掘研究创新点、复现实验,配合视频教学,新手快速上手文献综述写作


🍀后记🍀

博客的关键词集中在编程、算法、机器人、人工智能、数学等等,持续高质量输出中。

🌸讨论QQ群:白拾的小屋 (750365700)

⭐B站账号:白拾的物理AI组会(活跃于知识区和动画区)

✨GitHub主页:YhbCode000(工程文件)

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询