给机器人一个会预测未来的Critic,VLA强化学习直接起飞
近期OpenMOSS 团队开源了 World Critic ModelWCM。它提出了一个直接却常被忽略的问题机器人控制天然是一个部分可观测问题。既然一帧画面看不清动态为什么 Critic 还要“凭一帧图打分”一台机械臂正伸向转盘上的寿司。此刻它是在稳定接近目标还是已经错过最佳抓取时机夹爪与物体接触得恰到好处还是下一秒就会把寿司撞飞只看一张静态图片这些状态几乎一模一样。但在不少视觉-语言-动作模型强化学习VLA-RL方法中负责评价当前状态好坏的批评家模型Critic Model恰恰主要依赖单帧观测或单帧 VLM 特征来打分。这就像让一名只看比赛截图、没有回放的裁判判断运动员究竟是在完成关键动作还是已经失去平衡。近期OpenMOSS 团队开源了 World Critic ModelWCM。它提出了一个直接却常被忽略的问题机器人控制天然是一个部分可观测问题。既然一帧画面看不清动态为什么 Critic 还要“凭一帧图打分”图 1WCM 从单帧 Critic 的局限出发将世界预测与价值学习统一起来。WCM 的答案不是简单堆叠更多图像而是让 Critic 在估计价值的同时学习预测执行动作后的下一时刻潜在状态。换句话说它不仅要回答“现在有多好”还要回答 “照这样做下去接下来会发生什么”WCM 的代码、数据、权重全开源仅 15 分钟训练即可得到真机价值曲线论文标题WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning论文https://arxiv.org/pdf/2607.29613代码https://github.com/sylvestf/WCM数据https://huggingface.co/collections/Sylvest/wcmWCM 在 4 个仿真基准、149 项任务以及 7 项真实机器人任务上进行了系统验证覆盖抓取、柔性物体、长程和动态目标操作任务。同时WCM 可搭配三种主流 VLA 模型π₀、π₀.₅、OpenVLA-OFT。其中最醒目的结果之一来自 ManiSkill一个此前没有接触过 ManiSkill 数据、初始成功率仅 0.78% 的 VLA 模型在 WCM 引导的强化学习后达到 98.7%提升了 97.9 个百分点。更重要的是提升并没有只发生在训练分布内在 OOD 平均成功率上也取得了 72.7% 的提升。这组结果指向了 WCM 最核心的价值它不只是把训练任务做得更熟还让 Critic 在环境变化后更不容易看走眼。01VLA-RL 的 Critic可能一直少看了最关键的信息在 Actor-Critic 类强化学习中策略Policy决定做什么Critic 则负责判断这个状态有多好并据此计算优势、指导 Policy 更新。因此Critic 并不是一个可有可无的配角。Critic 的判断一旦失真Policy 就可能被非常自信地带向错误方向。图 2Critic 负责判断当前状态有多好。图为 WCM 的价值估计曲线当发生碰撞导致物体掉落时曲线开始下降。问题在于机器人操作通常可以建模为部分可观测马尔可夫决策过程POMDP。单帧画面可以告诉模型物体在哪里、机械臂大致处于什么姿态、当前场景包含哪些视觉元素。但它往往无法可靠告诉模型机械臂正在靠近还是远离目标夹爪是否刚刚发生滑移当前接触是稳定支撑还是即将碰撞目标物体是否仍在运动动作序列是在向成功推进还是已经进入不可恢复的失败……图 3机器人操作任务具有部分可观测性质智能体只能通过观测重建系统状态。以擦拭灶台为例同样是末端执行器接近桌面可能代表“正在施力清洁”也可能代表“机械臂被桌面卡住”。像素很像价值却完全不同。这也是为什么在真实机器人实验中单帧 Critic 容易学到一些危险的伪相关例如把“末端靠近桌面”一概视为高价值最终导致机械臂反复顶住台面。02反直觉的是给 Critic 多看几帧也未必有用既然单帧不够最自然的方案似乎是把多帧图像直接堆起来或者加一个时序 Transformer。但论文发现事情并没有这么简单。真正缺少的不是“历史输入”本身而是迫使模型理解历史变化的监督信号。传统 Critic 的核心目标通常只是回归一个标量回报。面对高维图像序列这个监督过于稀疏。即使输入中包含过去几帧模型也可能把它们当成一块更大的静态特征而不是去学习物体如何运动、接触如何变化、动作将把环境带向哪里。实验中出现了三个值得注意的现象1直接给原始 Critic 增加历史观测性能可能反而下降2换成具备时序建模能力的 Transformer但不加入世界预测目标仍然难以利用历史3只有在加入未来状态预测后多帧历史才稳定转化为更好的价值估计。图 4MLP、仅时序 ViT 与完整 WCM 的对比。完整 WCM 在不同骨干和任务上取得最高整体表现。这个结论也解释了一个常见误区 “有记忆”不等于“理解动态”只有可预测的历史表征才更接近机器人真正需要的状态。03WCM 怎么做让 Critic 一边打分一边做未来推演WCM 基于轻量级 LeJEPA 风格架构由四个关键部分组成观测编码器、世界预测器、价值头、动态预测头。整个过程可以拆成四步图 5WCM 核心架构共享的历史表征同时服务于价值估计与下一潜在状态预测。第一步编码连续历史。WCM 接收最近 K 帧观测。每一帧先被独立编码为潜在表示。在不同实现中编码器既可以是 ViT也可以直接复用 VLA 的 VLM Backbone。第二步加入语言条件。机器人执行的不是无条件动作。“把胡萝卜放到盘子里”和“折叠毛巾”即使视觉画面相似对状态价值的定义也完全不同。因此WCM 通过语言编码与适配模块把任务指令注入历史表征。第三步用因果时序模型聚合历史。经过语言条件化的多帧特征被送入因果 Transformer World Predictor形成当前的历史状态表示。这个表示不是简单的多帧拼接而是要同时支持两件事判断当前状态的预期回报结合当前动作预测下一时刻的潜在状态。第四步双头联合学习。WCM 设置两个轻量预测头Value Head 输出当前状态价值World Head 接收动作条件预测下一潜在状态。其总体目标可以概括为总损失 价值回归损失 世界预测损失 特征空间正则损失。其中特征空间使用 SIGReg 抑制潜在表示发生维度坍缩。这里有一个设计细节非常关键价值估计保持 action-free而状态转移预测是 action-conditioned。也就是说WCM 不会把状态有多好和执行某个动作后会怎样混为一谈却又允许两类目标共同改善共享表征。WCM 也不是一个额外生成像素、规模庞大的视频世界模型。它预测的是任务相关的下一潜在状态目标非常明确让 Critic 学会捕捉对价值判断真正有用的动态。04它不绑定某一种 RLOn-policy 与 Off-policy 都能接WCM 的另一个特点是没有重新发明一整套强化学习算法而是作为 Critic 接入现有训练流程。在同策略On-policy学习场景中自回归 VLA 可接入 PPOFlow Matching VLA 可接入 Flow-SDEWCM 提供价值估计用于计算 Return 与 GAE Advantage在异策略Off-policy学习场景中OpenVLA-OFT 可结合 AWRπ₀.₅ 可结合 RECAPSFT 数据、成功 Rollout 和失败 Rollout 被放入统一数据缓冲区用于持续更新 Critic 与 Policy。图 6WCM 可直接嵌入 On-policy 与 Off-policy 两类 VLA-RL 管线。这种模块化设计意味着WCM 更像一次对 Critic 表征学习方式的升级而不是只能在特定 Policy 或特定算法上生效的技巧。05实验结果IND 和 OOD 的双重 SOTA在 RL4VLA 设置的 Maniskill 任务上加了 WCM 的强化学习取得了分布内IND和分布外OOD的双重 SOTA 性能。更令人瞩目的是在零样本Zero-Shot设定下WCM 直接将近乎无效的 0.8 分拉升至 98.7 分提升高达 97.9 分充分验证了其卓越的泛化能力与强化学习适配效果。表 1WCM 在 Maniskill 分布内和分布外测试集上取得 SOTA 结果。团队在 LIBERO-Plus 基准上设计了一组极具说服力的对比实验。其中One-SFT 表示每项任务仅提供 1 条示范数据而 Full-SFT 则提供多达 50 条。实验结果显示基于 One-SFT 的 WCM 方法仅需约 250 步的强化学习微调便能从极简的初始策略出发在总体性能上成功反超依赖大量示范的 Full-SFT 基线。表 2WCM 在 LIBERO-Plus 泛化测试基准上通过 250 步 RL 训练即可超越 Full-SFT。这并不意味着示范数据不重要而是说明当 Critic 能更准确地理解动态与结果环境交互产生的失败数据也可以变成非常有价值的学习信号。在 MetaWorld 与 CALVIN 上WCM 同样使得持续接触和长程操作的表现稳定提升。图 7WCM 在 MetaWorld 成功率与 CALVIN 平均任务完成均取得亮眼表现。真机方面团队在 WidowX-250S 上测试了 7 个任务胡萝卜、香蕉、甜椒抓取放置叠衣服、叠毛巾灶台整理转盘寿司动态抓取。每项任务首先采集 100 条遥操作轨迹随后进行 8 轮 RL 更新每轮、每项任务收集 50 条 Rollout。相较于使用 VLM Critic Model 进行 RL 训练使用 WCM 的方法可以取得更好的性能。表 3使用 WCM 进行真机强化学习可以获得比 VLM Critic 更好的效果。真实机器人设置中的 WCM 约有 107.2M 可训练参数。数百到数千条轨迹的数据规模下WCM 可在不到半小时内完成快速迭代。而且这种提升不只体现在最后有没有成功WCM 训练出的 Policy 动作更连贯停顿和无效小动作更少因此单位时间内的吞吐量也更多。图 8在叠毛巾、灶台整理和抓取旋转寿司任务上RECAP WCM 的吞吐量均高于 Gemma Critic。06价值曲线可视化WCM 仓库提供了价值曲线视频生成工具。把模型预测的价值叠加到真实轨迹后可以直观看到它如何评价动作进展。图 9对于成功轨迹价值随任务推进整体上升。图 10对于失败轨迹从开始失败的时刻起价值快速下降。图 11对于无效轨迹随机运动没有形成稳定的成功趋势。可视化说明 WCM 学到的并非简单的终点分类器而是一个能够反映过程变化的连续评价信号。在真实数据中暂停、滑移、碰撞、抓姿不佳或折叠不整齐都会让价值曲线停滞或下降。07结语如果你正在研究 VLA、机器人强化学习、Critic Model 或真机后训练WCM 提供了代码、数据处理脚本、训练配置、模型权重以及价值曲线可视化工具适合作为一个新的可复现基线。当机器人不再只看“这一帧”它才更有可能理解自己正在走向哪里。