物理AI+飞捷科思CTO杨鼎康|新一代物理世界模型Fysiverse,正在打破WM边界 世界模型太火了在WAIC2026人工智能大会上在具身智能展馆中世界模型代替VLA登上了舞台。6月AI教母李飞飞world Lab团队发文将世界模型分为三大类渲染器以像素的形式输出观测专供人眼欣赏主打一个长得像模拟器输出几何、物理和动力学状态人类和程序都能拿去算、去交互主打一个算得准规划器输入观测和目标直接告诉机器人“下一步该咋办”主打一个能指挥。以前这三类各干各的渲染器是动作进去画面出来规划器反过来是画面进去动作出来。但李飞飞预言这三条路的边界正在消失视频模型开始接受动作指令三维模型开始输出碰撞网格规划器也开始在脑子里推演未来。在WAIC2026的物理智能论坛上飞捷科思这家由英伟达物理引擎奠基人张立华教授回国创立的物理AI时代Infra的公司发布了他们的新一代物理世界模型Fysiverse。这套东西恰好把李飞飞的预言搬到了现实里它既是渲染器也是模拟器更是规划器。抛开晦涩的技术概念从飞捷科思CTO杨鼎康博士的演讲中抽丝剥茧来看清楚Fysiverse世界模型到底是怎么回事以及对具身机器人来说到底意味着什么01世界模型火爆的另一面不同路线仍然存在问题飞捷科思CTO杨鼎康博士一开篇就提到从物理AI完整闭环来看一个智能系统要进入真实世界不能只有感知也不能只有大模型推理。机器人需要从摄像头、传感器和任务指令中识别对象、空间、材料和关系将它们转化成可计算的世界状态随后通过世界模型和物理引擎预演动作可能产生的结果再完成规划、策略选择和风险控制最终在真机上执行并将反馈重新送回系统。世界模型位于这个闭环的中间连接“看懂世界”和“在世界中行动”。为什么世界模型如此重要因为真实世界不能无限试错。机器人抓取失败可能损坏物体工业产线上的错误动作可能造成碰撞、停机甚至安全事故。因此物理AI必须具备行动前的预演能力。给定当前状态、动作目标和物理约束系统需要提前推演下一刻的状态、轨迹和风险。只有形成感知、建模、推演、决策、执行、反馈的闭环AI才能从回答问题走向承担真实任务。Fysiverse要解决的正是这一闭环中最难也最缺失的世界推演环节。从杨博士的总结来看不同世界模型虽然技术路线各异但至少需要具备三个共同能力第一承载世界状态和历史记忆第二接受动作输入并反馈状态变化第三产生可用于训练和决策的未来结果。换句话说世界模型的核心并不是生成一段连续视频而是承载状态、接受动作、推演结果。从技术形态上来看现有世界模型主要有三条路线但也各有局限。视频世界模型擅长从像素中学习时空相关性视觉表现力强但是视觉生成不等于物理应用正确可能发生穿透隐式世界模型在浅空间中建模状态更适合学习和决策局限在于隐式表征难以直观验证很难解释它是否遵循物理规律三维世界模型恢复明确的空间结构能够观察和慢游但没有质量摩擦和接触关系不等于可交互、可仿真。对于物理AI来说关键不是结果看起来合理而是接触是否正确、受力是否一致、材料是否产生正确的响应应用结果能否被复现和验证。飞捷科思认为下一阶段并不是简单地选择提供一条路线而是需要把它们统一到可计算、可验证的物理状态上。如李飞飞所言未来统一世界模型可以根据不同需求进行三种投影面向人类输出像素和观测它是渲染器面对系统输出对象、几何和物理状态它是模拟器面向机器人输出动作和策略它是规划器。三者并不是割裂的产品而是同一世界状态在不同任务上的表达这里模拟器是结构型骨架因为只有掌握世界状态如何演化模型才能够既生成可信画面也为具身智能提供可靠的动作依据。当生成模型开始进入模拟领域也带来新的风险几何看起来正确并不代表具有正确的物理属性。因此面向物理AI的世界模型至少要满足四个要求:1. 显示承载对象、材料接触和约束;2. 能够接受机器人的动作任务、目标和环境条件;3. 下一个状态来自可计算的物理演化;4. 整个过程应该可回放、可复现、可评估。只有这样世界模型输出的结果才能真正用于训练决策和安全验证而不仅是用于展示。02范式拆解Fysiverse打破世界模型的边界物理世界模型Fysiverse从真实观测出发先重建可仿真的三维世界再利用参数和引擎来预演未来的状态最后把物理预演转化为生成过程中的强约束使结果同时具备视觉真实性和物理可信度整个体系包含三个部分。1. Real-to-Sim负责把二维观测转换成可仿真的三维场景;2. Sim-to-Sim负责在物理规律下演化状态;3. Sim-to-real阶段负责把可验证的物理过程转译为视频和观测。图飞捷科思物理世界模型Fysiverse1Real-to-Sim把二维观测变成可仿真场景Fysiverse可以接收文本、图像或全景观测。首先由Fysiverse-3D完成对象级分割、三维重建、几何和材质生成以及空间布局恢复。它要回答的是这个世界里有什么它们分别在哪里这里的重点不是生成一张看起来立体的图而是让每个对象保持独立身份。桌子、椅子、杯子、柜子不再黏在同一张画面里而是成为可以单独移动、替换和编辑的三维资产。系统还会根据提示词中的前后、左右、上下、支撑和遮挡关系将物体放到合理位置使场景能够进入后续的物理参数补全和仿真流程。除了文本生成Fysiverse-3D也支持从单张RGB图像恢复三维场景。图从全景图重建3D世界即使是一张随手拍摄的办公室、客厅照片甚至卡通风格图像系统也可以尝试拆解出独立对象并恢复成可编辑的三维布局。单张图片天然存在遮挡和尺度不确定性因此这里的目标并不是一步到位地还原绝对真实而是以更低的输入成本构建一个可继续修正、可进入仿真的场景基础。与英伟达以视频为主要输入的SimFoundry相比Fysiverse-3D强调从单张图像出发降低场景数据采集门槛。同时其相关管线已经开源并兼容现有生态希望将Real-to-Sim从一项展示能力变成研究者可以直接使用和验证的基础工具。2Sim to Sim给三维世界补上物理含义创建了几何世界之后还需要理解其中的物理含义要知道物体的密度、摩擦、硬度、弹性和形变趋势。OmniFysics是全模态物理理解构建的基础模型承担的就是这部分工作。这个概念比英伟达的cosmos要早了至少半年。在多个国际公开的物理AI感知评测基础上当前的3B版本在综合指标上领先同尺寸模型并在大部分指标上超过了更大size的模型。OmniFysics将分散在图像、文本、音频和物理任务中的知识转化成可以被仿真系统记录和调用的物理参数与约束。图具备物理属性的世界生成随后Fysics物理引擎负责进行动力学、碰撞和约束求解。这一步回答的是这个世界按照什么物理规律运行3Sim-to-Real把推演后的状态转成视频景有了几何、材料和约束系统便可以推演未来。真实世界不只有刚体同一个物体还必须处理软体、流体等不同的物质形态。Fysiverse-Video将材料类型与物理参数真正放进状态演化链路在同样的受力条件下因为硬度、密度和摩擦的不同会产生完全不同的形态、流动、堆积甚至是碰撞过程。多材质不是替换视觉纹理而是真正改变物体在物理运动过程中的演化规律使最终的视频继承了一个可检查、可验证的物理过程。Fysiverse-Video另一个关键能力是可控同一个初始场景、方向、初速度和弹性参数不同未来的结果就应当不同。图多参数可控直接把这些参数作为推演条件无论是向左、向右还是向后速度从低到高弹性从弱到强系统都会产生对应的轨迹碰撞和回弹结果可控性非常重要。因为机器人训练和工程评测需要系统性地改变条件构造可比较的实验而不是依赖一次不可重复的随机生成。因此Fysiverse的核心区别并不是把下一帧生成得更漂亮而是先计算下一时刻的世界状态再将其转换成画面。03物理世界模型Fysiverse对具身机器人落地意味着什么将Fysiverse放到具身操作中其价值就更加直接。它可以在不同机器人本体、不同场景和不同任务下进行大规模状态推演。图Fysiverse对具身落地的价值重点不是生成某一个固定机械臂的演示而是建立统一接口将机器人动作、对象状态和场景约束送入同一套世界推演链路。这样一来系统可以批量产生成功操作、失败操作、危险操作以及现实中难以采集的长尾交互数据。这些数据可以用于策略训练和风险评估。对于机器人来说真正有价值的结果不是视频看起来像机器人在工作而是机器人动作和对象状态之间存在可靠的因果关系。例如在刚体案例中一排柜子依次倒下系统需要正确处理碰撞顺序、接触传播、动量传递和物体不穿透。图推演减少99%物理幻觉在流体案例中水团在重力作用下坠落、破碎和飞溅水的体积、方向和表面变化需要保持前后连续而不是每一帧各自生成。在软体案例中泰迪熊弹起后落下系统不仅要保持整体轨迹还要处理局部形变、弹性恢复和能量耗散。这些案例想证明的是刚体、流体和软体都能够在同一套物理状态框架中被推演。Fysiverse的最终价值在于将真实世界转化成可复用的物理AI资产。第一类是可仿真的场景资产包括对象级三维模型、材料参数、空间布局和接触关系。第二类是受到动作和物理参数约束的状态与视频序列可以为机器人提供成功、失败和长尾交互数据。第三类是可重复的闭环评测任务。通过统一初始状态、动作脚本和物理条件不同机器人和策略模型可以在更接近的条件下训练和测试。图现实操作VS仿真训练对于机器人企业来说这至少可能带来三方面的价值。首先降低真实世界试错成本。机器人可以先在仿真环境中碰撞、滑落和失败再把筛选后的策略放到真机执行减少设备损耗和安全风险。其次补足长尾数据。现实数据采集往往集中在成功演示而碰撞、卡住、形变和失败动作成本更高也更危险。世界模型可以系统地改变条件批量构造这些稀缺样本。最后推动机器人评测走向可复现。今天很多机器人Demo的场景、物体和成功标准并不统一很难直接比较。可重复的世界模型任务有机会为机器人训练、策略验证、数字孪生和安全测试提供统一底座。结语下一代世界模型的竞争正在从画面质量走向世界状态与因果推演能力。飞捷科思的Fysiverse所代表的全新范式是让生成模型继续发挥视觉理解和表达优势同时通过显式物理模拟补足其在接触、受力、材料和因果建模上的短板。它不是简单地在渲染器、模拟器和规划器之间选择一条路线而是试图以模拟器为骨架将三者重新接起来。正如杨鼎康博士在结尾所说让世界模型从“看起来像真实世界”走向“能够服务真实世界”。