LeWorldModel:1GB显存运行的世界动作模型,JEPA框架实战解析 上周在 GitHub 上看到一个项目,叫 LeWorldModel,短短几天就冲到了 4k star。点进去一看,介绍里写着“1GB 显存可运行的世界动作模型”,基于 JEPA 框架。说实话,第一反应是有点怀疑的。现在但凡跟“世界模型”沾边的项目,动辄就要几十上百 GB 的显存,或者需要庞大的计算集群。一个声称 1GB 显存就能跑起来的模型,要么是概念验证的“玩具”,要么就是找到了某种极其巧妙的工程实现路径。但仔细看了代码和论文引用后,我发现这个项目的价值可能恰恰在于它的“轻量”和“务实”。它没有试图去构建一个能预测宇宙万物的通用世界模型,而是聚焦在一个非常具体且工程上可解的问题上:在给定当前状态和未来动作序列的情况下,预测未来的状态表示。这听起来很学术,但翻译成工程师的语言就是:我给你一个机器人的当前传感器读数,再给你它接下来要执行的一系列电机指令,我能预测出几秒钟后它的传感器读数会变成什么样。这个能力,对于仿真、控制、乃至自动驾驶的决策规划,都是底层刚需。很多人一听到“世界模型”就觉得是科幻概念,离落地很远。LeWorldModel 这个项目给我的启发是,或许我们不需要一开始就追求一个全知全能的“大脑”,而是可以先从解决一个具体、可度量、资源消耗可控的“小问题”开始。这篇文章,我们就来拆解一下 LeWorldModel 到底做了什么,为什么 1GB 显存就能跑,以及我们该如何理解和使用它。1. 先别被“世界模型”吓到:LeWorldModel 到底在解决什么问题?“世界模型”这个词被 Yann LeCun 等大佬带火之后,承载了太多想象。但在 LeWorldModel 这个具体的项目里,它的目标非常收敛。我们可以通过一个简单的类比来理解:想象你在玩一个第一人称的赛车游戏。你的屏幕就是“当前状态”(像素图像)。你按下“左方向键+油门”就是“未来动作序列”。一个理想的世界模型,应该能预测出几帧之后你的屏幕画面会变成什么样(车辆左转,景物变化)。但直接预测高维像素(RGB图像)极其困难,计算量巨大。LeWorldModel 做了一件更聪明的事:它不直接预测未来的“像素画面”,而是预测未来的“抽象表示”。这就像是,游戏引擎内部其实是用一堆向量(位置、速度、角度)来描述世界的,屏幕画面只是这些向量的渲染结果。LeWorldModel 试图学习的,就是给定当前状态的向量表示和未来动作,预测未来状态的向量表示。这就是 JEPA(Joint Embedding Predictive Architecture,联合嵌入预测架构)的核心思想。JEPA 由 Yann LeCun 提出,其核心是放弃对高维观察(如图像像素)的精确重建,转而学习一个抽象的、信息密集的“表示空间”(representation space)。在这个空间里进行预测,难度和计算量都大大降低。LeWorldModel 具体做了以下几步:编码(Encode):使用一个编码器(比如一个 CNN),将当前时刻的高维观察(如图像)压缩成一个低维的抽象表示向量。这个向量捕捉了当前状态的核心信息,丢掉了像素级的冗余细节。预测(Predict):有一个预测器(通常是循环神经网络 RNN 或 Transformer),它接收两个输入:a) 上一步得到的当前状态表示,b) 计划执行的一系列未来动作。它的任务是输出对未来多个时间步的状态表示的预测。训练目标:训练的目标不是让预测的“表示”和真实的“表示”在像素上一致,而是让它们在语义上相似。具体来说,是让预测的表示和真实的表示在表示空间里的距离尽可能近(使用对比学习等技巧),同时让无关的表示距离远。所以,LeWorldModel 的“1GB显存可运行”,秘密就在这里:目标降维:预测的是几十、几百维的向量,而不