摘要本文解读 arXiv 2026 论文《Video Generation Models are General-Purpose Vision Learners》。该论文提出GenCeption把大规模文生视频扩散模型改造为单步前馈的通用视觉感知模型通过统一 RGB 表示、可学习 token与统一 $L_2$ 损失让 8 类稠密/稀疏任务共用一个骨干与解码器其特别之处在于仅用纯合成视频数据训练即全面超越各任务专用 SOTA。实验表明法向 Hi4D mAE 10.99、深度 Goliath AbsRel 0.008、指代分割 MeViS JF 70.0且数据效率达 $7\times$-$500\times$为计算机视觉的生成式预训练范式提供了系统性证据。视频讲解点击观看 B 站视频摘要论文基本信息背景与动机研究主线从问题到结论基准/方法设计分类全景方法细节实验设计与结果结果对比总结关键发现局限性常见问题FAQGenCeption 和 Vision Banana 有什么区别为什么视频生成预训练比 CLIP、MAE 更好相机位姿怎么编码进 RGB 图像GenCeption 训练数据量有多大为什么联合训练会损害 3D 关键点GenCeption 开源吗参考链接论文基本信息项目内容标题英文Video Generation Models are General-Purpose Vision Learners标题中文视频生成模型是通用视觉学习者作者Letian Wang, Chuhan Zhang, Rishabh Kabra, Jasper Uijlings, Steven Waslander, Andrew Zisserman, Joao Carreira, Kaiming He, Misha Andriluka, Eduard Gabriel Bazavan, Andrei Zanfir, Cristian Sminchisescu机构Google DeepMind · U. Toronto · UCL · Oxford · MIT · Lund会议arXiv 2026arXivhttps://arxiv.org/abs/2607.09024项目网站https://genception.github.io背景与动机NLP 靠 next-token prediction 从任务专用模型收敛为通用基础模型计算机视觉却仍停留在专用模型阶段——SAM 系列管分割、Depth Anything 系列管深度每个任务都要定制架构。作者提出通用视觉预训练需满足三条准则时空演化内化 4D 因果与物理、视觉-语言对齐原生继承指令跟随、可规模化数据与算力可扩展。现有工作各有短板MAE/VideoMAE、DINO 等自监督表征缺少显式多模态对齐CLIP/SigLIP 对齐了图文却难做视频级表征且规模受限扩散复用路线Marigold、GenPercept、Diception多为单图单任务且依赖多步采样视频侧DepthCrafter/NormalCrafter聚焦单一稠密任务同期工作Vision Banana只覆盖二维图像空间。GenCeption 的关键差异是原生视频域 单步前馈 稠密/稀疏任务统一在标准 benchmark 上全面超越专用 SOTA。研究主线从问题到结论图 12GenCeption 研究主线——从视频生成到通用感知Mermaid 流程图基准/方法设计GenCeption 的方法论由三条原则驱动多模态生成预训练即表征学习——文生视频扩散模型作通用骨干生成高保真视频强制内化时空先验、3D 几何与物理规律同时原生对齐视觉语言概念为保留先验最大化兼容原预训练范式、最小化改动。任务无关的统一后训练——把感知任务视为统一的序列到序列映射稠密任务输出编码进标准 RGB 空间$[0,1]$文本提示切换任务单骨干单解码器单损失。前馈重构——把多步迭代采样改造成单步确定性预测兼顾精度与效率。图 1方法总览——视频生成模型作预训练基座左多任务后训练为前馈感知模型右图为从专用模型到通用模型的范式转移分类全景图 13GenCeption 任务分类——稠密任务统一进 RGB 空间稀疏任务由可学习 token 承载Mermaid 流程图方法细节前馈重构干净视频潜在 $x_0$ 直接输入 DiT时间步固定 $t0$Rectified Flow 终止点DiT 输出速度 $v \epsilon - x_0$取负后 $-v x_0 - \epsilon$ 更接近目标潜在加速收敛。本质是把 DiT 重铸为特征提取器特征直接取自最后一层与解码器原生对齐。稠密任务统一到 RGB深度/分割单通道复制为三通道法向/DensePose 天然三维相机位姿以像素级 raymap 表示6 通道通过空间分区——中心放射线原点、四周放射线方向——压缩进 3 通道保持单解码器框架。稀疏任务用可学习 token每帧追加一个可学习 query token经 MLP 解码为 $K$ 维坐标沿用原生 3D RoPE空间位置可学习时间位置用插值压缩到预训练所见范围优于额外注意力层方案。数据级消歧深度按场景中值归一化再用非线性映射 $d \mathrm{clip}(\alpha \log(d1), 0, 1)$ 压到 RGB 范围彻底免去 scale-invariant 等专用损失——任务差异化全部下沉到数据表示。合成数据管线800 个 RenderPeople 模型 × 200 段 CMU 动作Blender 多渲染通道生成 7,500 段视频同时产出法向、深度、分割、2D/3D 关键点真值离线预计算视频/文本潜在加速训练。训练补充 TartanAir、Virtual KITTI、MVS Synth深度指代分割用 MeViS/Ref-COCO/YouTube-VOS 真实数据。图 2架构总览——输入视频 文本提示一次前向输出目标模态稠密任务在 RGB 潜在空间监督稀疏任务由可学习 token 承载图 3Rothko Raymap——把相机位姿的六通道射线数据压缩进标准 3 通道 RGB训练配置WAN 2.1 基座1.3B/14B480×832 分辨率、81 帧 24fpsbatch 64 × 256 v6e TPUAdam lr $5e^{-5}$15,000 步250 步 warmupgradient clipping gradient dropping 保证稳定。实验设计与结果评测协议法向用 Hi4DSapiens/DAVID 协议1,195 帧与 SINTEL深度用 KITTI/SINTEL/ETH3D/GoliathDAVID 子集 2.2k 帧相机位姿用 SINTELATE/RPE-T/RPE-R前景分割用 VideoMatte/PhotoMatte 85/PPM-100MSE指代分割用 RefVOS-DAVIS 与 MeViSJF3D 关键点用 EMDBMPJPE。除指代分割外全部纯合成数据训练未使用任何评测集训练数据。与专用 SOTA 对比主表任务指标↓最强专用GenCeption L胜出幅度法向 Hi4D (mAE)Sapiens 12.1410.99-1.15法向 SINTEL (mAE)Lotus-2 30.329.3-1.0深度 SINTEL (AbsRel)D4RT 0.1480.130-12%深度 Goliath (AbsRel)DepthAnything 3 0.0120.008-33%相机位姿 SINTEL (ATE)VGGT-Ω 0.0570.050-12%指代分割 MeViS (JF)ReferEverything 60.370.016%3D 关键点 EMDB (MPJPE)Genmo 73.071.8-1.2前景分割 VideoMatte (MSE)RVM 0.00100.0010Generalist持平预训练范式与缩放深度平均 AbsRel方法规模训练帧数Avg AbsRel↓V-JEPA - H0.6B0.9M0.281VideoMAE V2 - G1B0.9M0.154Ours - WAN 2.1 - S1.3B0.9M0.122Ours - WAN 2.1 - L14B0.9M0.093DepthAnything 3 - G1.15B~200M0.096D4RT1B~86M0.082VGGT-Ω1B~600M0.067Ours - WAN 2.1 - L (4 数据集)14B1.23M0.071图 4能力总览——法向、深度、前景分割、指代分割、稠密人体语义、2D/3D 关键点、相机位姿仅训练于合成人体视频却泛化到动物与卡通角色图 5左通用能力雷达图——匹配或超越各任务专用模型右深度估计数据效率——$7\times$-$500\times$ 更少训练数据达到同等性能图 6预训练迁移消融——迁移预训练层数越多性能越高随机初始化 DiT 学习曲线近乎平坦图 7深度与表面法向估计定性结果首帧图 8指代分割定性结果——识别物体、颜色、空间关系与运动并分割未见类别图 9涌现泛化a——训练数据单物体零样本迁移到真实多人场景图 10涌现泛化b——仅训练人体类别泛化到猫等未见类别图 113D 姿态估计——滑雪/单板视频每 10 帧取一帧无需人体检测或 2D 关键点预处理推理成本1.3B 模型 81 帧 480×832 单次前向 5.92s 13.6 FPSDiT 0.96s、15.3GB 显存14B 模型 10.03s 8.0 FPSDiT 5.11s、42.8GB 显存——对比 WAN 2.1 原版 50 步扩散采样推理成本降低约一个数量级。结果对比总结图 14GenCeption 与各任务专用 SOTA 的对比总结Mermaid 流程图关键发现生成式预训练范式完胜同数据同规模下WAN 2.1 生成式预训练平均 AbsRel 0.09314B大幅优于 V-JEPA 的 0.281 与 VideoMAE V2 的 0.154——关键在生成目标本身而非数据集或规模。数据效率惊人14B 模型用 1.23M 帧达到 VGGT-Ω约 600M 帧同级水平即 $7\times$-$500\times$ 更少训练数据D4RT约 86M 帧同样被 1.23M 帧追平。缩放性质初现1.3B → 14B、数据翻倍深度误差单调下降从零训练 DiT 曲线近乎水平预训练层数越多收敛越好。涌现行为显著纯合成人体视频训练零样本迁移到真实多人场景与猫、机器人等 OOD 类别猫胡须等细节甚至超过训练数据画质。联合训练有代价前景分割受益于多任务联合训练但 3D 关键点 MPJPE 明显退化——token 坐标回归偏离像素空间先验可学习 token 干扰原生注意力。推理效率数量级提升14B 单次前向 DiT 5.11s对比 50 步扩散采样成本降低约一个数量级。局限性稀疏任务退化联合训练使 3D 关键点明显变差——token 回归与像素空间预训练本质相悖可学习 token 从零训练破坏预训练注意力。合成域依赖训练数据以人体为中心背景与物体多样性受限指代分割仍需 MeViS/Ref-COCO/YouTube-VOS 等真实数据补充。分辨率与显存开销480×832 输入14B 模型单次前向需 5.11s 与 42.8GB 显存虽比 50 步扩散快得多仍非实时。并发竞争与 Vision Banana、Wiedemer et al. 等工作同期范式归属与基准差异需后续检验。作者展望后训练应最小化对预训练骨干的架构改动或从根本上重新设计预训练目标以原生容纳多样化下游任务。常见问题FAQGenCeption 和 Vision Banana 有什么区别两者同为生成模型是通用视觉学习者的同期工作但 Vision Banana 只覆盖二维图像空间且采用多步生成GenCeption 扩展到原生视频域、采用单步前馈架构并在更广泛的任务谱系上做了定量评测。为什么视频生成预训练比 CLIP、MAE 更好因为生成高保真视频强制模型内化时空因果、3D 几何与物理交互且文本条件生成天然对齐视觉-语言语义CLIP 等对比方法缺时空建模MAE 等掩码方法缺模态对齐且视频表征模型规模普遍小一个量级。相机位姿怎么编码进 RGB 图像采用像素级 raymap每个像素记录一条射线的原点与方向共 6 通道通过空间分区——中心放射线原点、四周放射线方向——压缩进标准 3 通道 RGB保持单解码器框架不变。GenCeption 训练数据量有多大核心合成数据集 7,500 段视频800 个 RenderPeople 模型 × 200 段 CMU 动作深度补充 TartanAir、Virtual KITTI、MVS Synth指代分割用 MeViS/Ref-COCO/YouTube-VOS14B 模型全部训练帧约 1.23M仅为 D4RT 的约 1/70。为什么联合训练会损害 3D 关键点token 式坐标回归偏离连续像素空间预训练且从零训练的可学习 token 会扰乱预训练 DiT 层的原生注意力机制——说明后训练应最小化对预训练骨干的架构改动。GenCeption 开源吗论文基于开源的开源权重文生视频模型 WAN 2.1但 GenCeption 本身暂未发布权重与代码项目页面genception.github.io提供更多演示与细节。参考链接arXiv 论文https://arxiv.org/abs/2607.09024项目页面https://genception.github.ioVision Banana同期 2D 图像版本https://arxiv.org/abs/2604.20329Marigold扩散复用开山之作https://arxiv.org/abs/2311.17120B 站视频讲解https://www.bilibili.com/video/BV1n78G65Euk给大家推荐一款自用写文献综述、无虚构文献的 AI复旦大学 FudanNLP 团队自研 切问学术官网qiewenpaper.com覆盖3.6 亿篇可溯源真实中英文文献能自动整合文献观点生成规范综述还能挖掘研究创新点、复现实验配合视频教学新手快速上手文献综述写作后记博客的关键词集中在编程、算法、机器人、人工智能、数学等等持续高质量输出中。讨论QQ群白拾的小屋 (750365700)⭐B站账号白拾的物理AI组会活跃于知识区和动画区✨GitHub主页YhbCode000工程文件