写在前面【从零走向AGI】旨在深入了解通用人工智能AGI的发展路径从最基础的概念起逐步构建完整的知识体系。项目地址https://github.com/AI-mzq/From-Zero-to-AGI.git魔方AI空间猫先生从零走向AGI面试面经AIGC算法岗/开发岗面试面经交流社群涵盖AI Agent、AIGC图像创作、AI视频、LLM大模型、AI多模态、数字人、传统深度学习、具身智能等AIGC面试干货资源欢迎大家加入https://t.zsxq.com/YtJ09导读世界动作模型WAM通常让机器人同时预测动作与未来 RGB latent以更好的时空表征服务控制。但 RGB 重建并不直接约束操作最关心的两件事物体在三维空间的几何关系以及“这是什么、该与谁交互”的对象语义。若专门补齐它们直觉上需要深度传感器、新的视觉预训练或更慢的部署。Flex-π \piπ提出一个颇有工程意味的答案同一个冻结的 Wan-2.2 视频 VAE不只可编码 RGB也能近乎无损地编码由 RGB 推得的 3D pointmap再用冻结的 DINOv3 提取对象语义。RGB、点图、DINO token 和动作一起进入 Multi-Stream Mixture-of-TransformersMoT联合去噪。训练时随机隐藏输入流并要求模型仍预测每一未来流部署时则由用户决定只出动作还是同时生成 RGB、点图、DINO 的任意组合。这让“世界模型是否值得在推理时生成未来”不再是二选一。论文的 6B 模型在真实双臂任务上action-only 模式以 60 ms 的单次调用速度超过所有比较基线开启全联合生成会增加延迟却平均再提高 13% 成功率。RoboTwin 的低样本设置中作者报告相对基线 1.9–4.5 倍的成功率优势。论文 v2猫先生认为Flex-π \piπ最有价值的设计不是多加两种输入而是把多模态训练改造成可在运行时裁剪的监督预算快模式继承三流训练形成的表示慢模式再用未来视觉生成换取额外控制信息。论文标题Flex-π \piπ: A Multi-Stream World-Action Model with Compute Flexibility论文地址https://arxiv.org/abs/2608.10860项目主页https://flex-pi.github.io/GitHubhttps://github.com/geyan21/flex-pi 当前仅发布计划代码与权重尚未上线原文脉络论文先指出 RGB-only WAM 缺少显式几何和对象语义监督相关工作定位在 VLA、RGB latent WAM 与多模态操作之间。方法部分先定义三条视觉流及 MoT再说明 stream dropout 和 cross-modality forcing 如何训练一个可配置检查点最后给出 flow matching、预训练数据和推理。实验依次验证真实双臂操作、OOD 与数据效率、RoboTwin/LIBERO 大规模比较以及输入流、输出流和强制跨模态预测的消融。1-2. RGB latent 之外几何和对象语义为何要进入 WAMWAM 的优势在于动作 token 可以在去噪时读取模型正在形成的未来视觉表示。可多数 WAM 的视觉目标仍是 RGB latentVAE 的训练目标主要服务像素重建外观细节强却没有明确要求 latent 对三维深度或对象身份敏感。Flex-π \piπ使用的 pointmap 并非新传感器采集它由 RGB 经 Depth Anything 3 生成DINO 流也从相同 RGB 取得。关键观察是Wan-2.2 的冻结 VAE 能直接重建 image-shaped pointmap论文报告规范化空间中 PSNR 31.1 dB、MSE3.1 × 10 − 3 3.1\times10^{-3}3.1×10−3对应深度 z-RMSE 4.9 cm。于是几何流可复用视频 VAE 的空间与时间编码接口省去为 3D 另训生成先验的成本。图 1Flex-π \piπ以 RGB、DINO 语义和点图作为多条视觉流训练后可在 action-only 与全联合生成等模式间切换来源论文 Figure 1。图 1 的“灵活”有明确边界视觉输入的非空子集有2 3 − 1 7 2^3-1723−17种视觉输出子集有2 3 8 2^38238种二者组合为 56 种动作始终是输出。它不是让模型凭空获得新传感器而是在同一 RGB 来源下决定是否计算、输入和生成这些派生表征。3. Flex-π \piπ共享 latent 空间上的多流联合生成3.1 三条视觉流与 Multi-Stream MoT输入是 RGB 图像o t o_tot、点图p t p_tpt、DINO 特征d t d_tdt、本体状态s t s_tst和语言l ll。RGB 和点图经同一冻结 VAE 得到 latent tokenz t o , z t p z_t^o,z_t^pzto,ztpDINOv3 的 patch token 经过2 × 2 2\times22×2无损折叠token 数降为四分之一、通道从 768 变为 3072再以线性 adapter 接入共享主干。折叠降低了 DINO 生成对注意力序列的压力但不丢弃 patch 特征。图 2RGB 与点图共享 Wan VAE 编码DINO 走独立冻结编码器三条流经各自 projector 进入 5B 视觉主干1B 动作专家生成动作块。输入掩码选择可见流输出掩码选择动作能读取的未来视觉流来源论文 Figure 2。模型总量约 6B5B 视觉 Transformer 由 Wan-2.2-5B 初始化动作专家约 1B、宽度更窄。三条视觉流共享 30 层视觉主干但有各自的 Q/K/V、归一化和前馈参数跨流注意力仅放在中间 16 个 block让浅层编码与末层解码保留流特异性。动作 token 在联合生成时可读取当前视觉和被启用的未来视觉 token视觉 token 永远不读取动作维持从观测到动作的因果方向。图 3同一冻结 Wan VAE 编解码 RGB 与 pointmap论文用连续帧对比显示点图重建与真值接近。这是无须训练专用 3D VAE 的实证基础来源论文 Figure 3。猫先生认为共享 VAE 对 pointmap 的“免费复用”是这套方案的前提而不是普通的把深度图拼到 RGB 通道。同一 latent 接口使点图能够沿用视频模型的 tokenization、时间压缩和主干初始化才让多流训练没有演变成三个昂贵系统的拼装。3.2 Stream dropout 与 Cross-Modality Forcing掩掉输入不掩掉监督训练中有两个独立 mask输入存在掩码m i n \mathbf m^{\mathrm{in}}min决定时刻t tt哪些流可见输出注意力掩码m o u t \mathbf m^{\mathrm{out}}mout决定动作 token 读取哪些未来视觉流、以及未来流之间怎样交互。每个输入流以 0.5 概率丢弃但保证至少留一条。容易忽略的一点是m o u t \mathbf m^{\mathrm{out}}mout不是 loss mask。即使点图没有作为输入也仍要预测它的未来 latent 并承担损失模型必须从 RGB/DINO 推出它。反过来DINO 或 RGB 也会被迫从其他流恢复。作者将这称为 cross-modality forcing。图 4一次训练样本由输入存在掩码和输出注意力掩码共同定义。星号案例中点图不作为输入却仍参与未来联合生成构成 cross-modality forcing来源论文 Figure 4。这种训练覆盖并非只为“缺传感器时能跑”。其更强的约束是让三流在共享主干里互相可预测避免形成并列而割裂的 RGB、几何、语义通道。论文在 RoboTwin 消融中报告移除 cross-modality forcing 后成功率下降 21%。3.3 联合目标、数据与运行时模式动作与 RGB、DINO、pointmap 三条未来流共同训练。除高维折叠 DINO 使用x xx-prediction直接预测干净特征外其余都使用 flow matching总目标为L ( θ ) λ a L a F M ∑ i ∈ { o , d , p } λ i L i F M 。 \mathcal L(\theta)\lambda_a\mathcal L_a^{\mathrm{FM}} \sum_{i\in\{o,d,p\}}\lambda_i\mathcal L_i^{\mathrm{FM}}。L(θ)λaLaFMi∈{o,d,p}∑λiLiFM。论文所有实验设λ \lambdaλ为 1强调所有未来流都持续受监督。预训练使用 AGIBOT World-Beta 的约 500 小时、100 个任务含头部与双腕相机之后针对每个实验域微调。推理按用户选定的输入/输出 regime仅在活跃输出流上以 Euler 步积分 flow ODE。现实机器人动作块为 32 步RGB 与点图从 33 帧窗口以 stride 4 采样成 9 帧再经 VAE 的时间压缩成为当前和两帧未来 latent。真实机器人每次执行整段 32 步LIBERO 则每 10 步重规划因此不同基准的闭环反应频率不可直接混为一谈。4. 实验灵活运行模式到底换来了什么4.1 真实双臂操作精准、长程与可形变物体真实评测平台是双臂 YAM涵盖放盘入架、餐具分类、厨房整理、自修夹爪、软包拉链五项任务。后两项最苛刻自修夹爪需要用电动螺丝刀完成八阶段装配最紧处是 4 mm 批头插入 4.5 mm 套筒横向余量± 0.25 \pm0.25±0.25mm软包拉链中目标会随抓取改变位置。每个任务 10–20 次 rollout以任务完成度和完整成功率计分。图 6五项真实双臂任务的完成度与完整成功率。Flex-π \piπ的 action-only 与 full joint 均超过π 0.5 \pi_{0.5}π0.5、ManiFlow、Fast-WAM来源论文 Figure 6。论文报告 full joint 相比最强基线在 Kitchen Organization 高 5.0 个任务完成度点在 Self-Repair Gripper 高 42.7 点、Soft-Bag Zipping 高 27.2 点。五任务平均完整成功率上full joint 为π 0.5 \pi_{0.5}π0.5的 3.5 倍、为 ManiFlow 的 2.3 倍。注意Fast-WAM 未在两项最难任务上评测因此其平均成绩并不覆盖相同任务集合。4.2 OOD 与样本效率生成未来的价值主要出现在哪里在未见物体、极端杂乱和干扰物条件下full joint 平均只掉 4.7 个点action-only 掉 4.1 个点ManiFlow 掉 26.7 点π 0.5 \pi_{0.5}π0.5在未见软包上掉 25.6 点。以一半真实示范微调时full joint 仍超过以全数据训练的所有基线action-only 的表现与全数据π 0.5 \pi_{0.5}π0.5接近。RoboTwin 的 50 任务完整数据评测中Flex-π \piπaction-only / full joint 均为 94.6%和最高 VLA93.9%或 WAM93.6%差距已很小。真正拉开差距的是 50、100、500 条示范的缩放实验论文报告低数据区间比π 0.5 \pi_{0.5}π0.5、LingBot-VA、Fast-WAM 高 1.9–4.5 倍。因而“联合生成更好”的主要证据是数据稀缺和困难真实任务而不是接近饱和的 RoboTwin 全数据分数。4.3 速度—性能边界一个 checkpoint 的多档部署在 5 个 RoboTwin 任务、每任务 50 条示范的消融中给定 RGB-only 输入action-only 为 40.2% 成功率、约 60 ms再生成 RGB 为 60.4%三条视觉流全开为 63.8%、约 193 ms。相同检查点跨越超过3 × 3\times3×的延迟和 24 个成功率点。真实任务上作者同样报告 action-only 的 60 ms 调用时间并称其快于所有比较基线。图 7五项真实任务的平均完成度与测得推理延迟。action-only 位于低延迟端全联合生成以额外时间换取更高完成度来源论文 Figure 7。这张图比单一“速度更快”更有解释力Flex-π \piπ允许部署者根据控制周期、算力与容错选择输出流而不是为每个速度档重复训练模型。代价也很实际联合生成仍慢于参数量相近的 VLA论文承认多流与 cross-modality forcing 使真实任务至少需要 10 个 epoch 才收敛。4.4 输入与训练规则的消融作者在 RoboTwin 上逐步加入输入流视频 DINO 比视频-only 多 6.8%再加入 pointmap 额外多 20%。这说明语义与几何并非仅作为花哨输出而是在训练过程中改善了策略表示。未来视觉在部署时是否生成则是另一层选择行动-only 已可受益于三流联合训练full joint 再通过动作 token 读取演化中的未来表征获取额外收益。5. 局限与可复现性“无新传感器”应理解为部署不需要深度相机训练与微调仍须运行 Depth Anything 3 生成点图、运行 DINOv3 提取语义也须承担三流 future target 的计算和存储。VAE 对 pointmap 的重建质量是论文方法的重要假设面向不同相机内参、尺度、室外反光材质或遮挡时的稳定性仍需更多检验。实验强项在于有真实双臂、OOD 与数据效率证据边界在于试验任务数有限、真实每任务仅 10–20 rollout且部分比较基线的完整数据成绩来自公开报告、低数据则由作者重训。项目 GitHub 当前仅说明代码与预训练 checkpoint “即将推出”尚不能直接复现 6B 模型、预训练或优化后的 60 ms 测量。总结把“是否预测未来”变成运行时选择Flex-π \piπ的贡献可以收束为三层表征层用同一视频 VAE 承载 RGB 与点图用 DINO 补充对象语义让 WAM 的未来监督触及外观、几何和语义训练层以 stream dropout 和 cross-modality forcing 让各流互相可推断令额外模态即使在部署时不出现也能改善动作表示部署层单一 checkpoint 可以只出动作追求低时延也能联合生成未来视觉换取更高成功率。对 WAM 路线而言它提示的不是“模态越多越好”而是额外表征应当既能在训练中形成互补监督也能在部署时按收益决定是否启用。Flex-π \piπ把这个开关从模型设计阶段推迟到了运行阶段。推荐阅读► 技术资讯 魔方 AI 新视界► 项目应用开源视界► 技术专栏 多模态大模型最新技术解读专栏 | AI 视频最新技术解读专栏 | 大模型基础入门系列专栏 | 视频内容理解技术专栏 | 从零走向 AGI 系列