VideoWorld入门教程:10分钟配好环境,快速搞懂世界模型与LDM潜空间核心概念
VideoWorld入门教程10分钟配好环境快速搞懂世界模型与LDM潜空间核心概念【免费下载链接】VideoWorld[CVPR 2025] VideoWorld is a simple generative model that learns purely from unlabeled videos—much like how babies learn by observing their environment.项目地址: https://gitcode.com/gh_mirrors/vi/VideoWorldVideoWorld是 CVPR 2025 论文《Exploring Knowledge Learning from Unlabeled Videos》的官方开源项目一个只用无标注视频就能学会复杂知识的视频生成世界模型。它不依赖奖励信号和人工标注仅靠看视频就能掌握围棋规则达到5段专业水平和机器人控制操作。本教程将带你快速完成环境配置并讲透世界模型与LDMLatent Dynamics Model潜空间动态模型两大核心概念。为什么需要世界模型传统方式各有硬伤强化学习RL依赖任务奖励泛化差监督学习SL标注成本高文本学习缺乏视觉信息。而 VideoWorld 的思路更像婴儿——纯靠观察视频理解世界再通过生成视频的方式完成任务输入围棋对局视频、机器人操作视频无标签过程模型学习画面接下来会怎么变输出自主预测下一步落子 / 机器人动作核心概念一LDM 潜空间动态模型LDM 是 VideoWorld 的灵魂组件它的工作分两步视觉动态压缩把第 t 帧到未来 H 帧的画面变化如棋子的移动、机械臂的抓取压缩成少量紧凑的潜代码latent codes存入 Latent CodeBook自回归预测Transformer 像预测文本 token 一样逐个预测下一个潜代码再解码回视频帧关键洞察表示变化而非像素才是知识学习的关键。潜代码把黑子落子、白子提子、机械臂挥动这类语义变化编码出来让模型学到的是规则而非像素。核心源码位置纯文本路径便于你自行查阅LDM 模块VideoWorld/LDM/ldm/models/autoencoders/magvit_v2_ldm.py自回归算法VideoWorld/VideoWorld/falcon/models/algorithms/VideoWorld 2 的解耦 dLDMVideoWorld2/videoworld2/latent_dynamics/discrete_video_latent_dynamic.py核心概念二两阶段训练流程阶段训练什么启动脚本阶段1LDM 训练视觉→潜代码的压缩器VideoWorld/LDM/tools/calvin_ldm_train.sh阶段2Next Token 预测自回归 TransformerVideoWorld/VideoWorld/tools/calvin_train.sh围棋对战任务同理潜代码 棋盘图像构成训练序列模型学会看棋局→预测下一手。一键环境配置10分钟搞定前置要求Anaconda/Miniconda 支持 CUDA 的 NVIDIA GPU。第一步克隆仓库git clone https://gitcode.com/gh_mirrors/vi/VideoWorld.git cd VideoWorld第二步创建 conda 环境两个子项目依赖不同建议分开建环境# VideoWorld (CVPR 2025) conda create -n videoworld python3.10 -y conda activate videoworld pip install --upgrade pip pip install torch2.1.0 torchvision0.16.0 torchaudio2.1.0 --index-url https://download.pytorch.org/whl/cu121 # VideoWorld 2 (CVPR 2026) conda create -n videoworld2 python3.11 -y第三步安装依赖bash install.sh该脚本自动安装 mmengine、mmcv、gym、CATALOG 相关组件及 KataGo 围棋引擎等依赖一次跑完即可全程约 10 分钟视网络而定。快速上手跑一次推理 围棋对战将官方权重go_fsq.pth、go_battle.pth放到work_dirs/目录后启动脚本即可人机对弈cd VideoWorld bash ./tools/battle_vs_human.sh 机器人任务CALVIN按官方说明下载 CALVIN 数据集放到data/calvin目录然后运行tools/calvin_test.sh即可评测抽屉开关、推方块、开关灯等任务。✂️ VideoWorld 2 手工任务以一张场景图如纸飞机为输入dLDM 潜代码驱动生成完整任务执行视频cd VideoWorld2 bash scripts/test.sh项目结构导航目录作用VideoWorld/LDM/阶段1潜空间动态模型训练编码器/解码器、FSQ 量化器VideoWorld/VideoWorld/falcon/阶段2自回归 Transformer模型、数据集、训练引擎VideoWorld/VideoWorld/tools/训练/对战/测试启动脚本VideoWorld2/videoworld2/latent_dynamics/解耦 dLDM 与 Cosmos 视频分词器VideoWorld2/examples/文本/图像/动作条件生成示例脚本常见问题速查推理时报bos_token_id has to be defined按官方 README 指引修改本地transformers/generation/utils.py的对应行即可不想装 KataGo默认评测不需要仅在需要精细着法分析时才运行VideoWorld/install_katago.sh权重从哪来官方 README 中给出的 Hugging Face 页面链接可直接下载写在最后VideoWorld 证明了看足以产生懂。从无标注视频到5段棋力、到机器人多任务控制LDM 潜空间让知识学习既高效又可迁移。建议先按上文跑通一次围棋对战再阅读LDM与falcon两大模块源码即可完整掌握世界模型的实现脉络。【免费下载链接】VideoWorld[CVPR 2025] VideoWorld is a simple generative model that learns purely from unlabeled videos—much like how babies learn by observing their environment.项目地址: https://gitcode.com/gh_mirrors/vi/VideoWorld创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考