如果让模型看一段视频,它能不能回答:“下一秒会发生什么?”
如果再给它一个动作,比如“向左走”“抓住杯子”或者“把镜头转过去”,它能不能先在脑中模拟几步,再决定现实里要怎么做?这就是世界模型(World Model)想解决的问题:模型不只识别当前画面,还要学习一个可以预测未来的内部世界。
不过,“世界模型”并不是某一种固定网络结构。今天常见的路线,至少可以分成三类:
- Dreamer:把世界压缩到潜空间里,在内部状态上想象未来,再用想象轨迹训练策略;
- Genie:学习生成未来的视觉内容,把视频变成一个可以被动作驱动的交互式环境;
- JEPA:不执着于还原每一个像素,而是预测未来或遮挡区域的抽象表征。
它们都在回答“未来是什么样”,但预测的对象、动作的角色和计算成本完全不同。先看一张总览图:
一、先把“世界模型”说清楚
普通的视觉模型通常在做分类、检测或分割:给定一张图,输出一个答案。世界模型更关心的是时间关系:当前状态是什么,采取动作后会发生什么,以及哪一条未来轨迹更值得选择。
可以用一个简化的循环表示:
这里:
- 是当前观测,可以是图像、视频帧或机器人传感器读数;
- 是压缩后的内部状态,不一定能直接看懂,但要保留决策需要的信息;
- 是动作,可能来自智能体、机器人控制器,也可能是从无标签视频中推断出的潜在动作;
- 、 或 是模型对未来的预测。
关键在于“预测什么”。如果预测每个 RGB 像素,输出容易被纹理、光照和背景细节牵着走;如果只预测一个过度压缩的向量,又可能丢掉碰撞、遮挡和动作后果。世界模型的设计,本质上是在“足够准确”和“足够高效”之间找平衡。
还有一个容易混淆的点:有预测未来的模型,不一定就是完整的控制系统。要让世界模型真正驱动机器人或游戏角色,通常还需要策略、价值函数、规划器、动作解码器,以及对长时滚动误差的评估。世界模型是决策闭环中的预测部分,不等于整个智能体。
二、Dreamer:在潜空间里想象未来
1. 英文全称与代表论文
Dreamer 不是一个单独版本,而是一条不断演进的模型式强化学习路线。早期代表论文是 Danijar Hafner 等人的 Dream to Control: Learning Behaviors by Latent Imagination,最初于 2019 年公开,后发表于 ICLR 2020。更成熟的代表是 DreamerV3:Hafner、Pasukonis、Ba 和 Lillicrap 的 Mastering Diverse Domains through World Models,预印本发表于 2023 年,后发表于 Nature(2025),正式论文可见 DOI 页面。
所以,文章里说“Dreamer 路线”,通常不是指一个固定版本,而是指“用潜状态学习动力学,再在潜状态里做想象和控制”的方法族。
2. 它到底在想象什么
Dreamer 的基本流程可以拆成四步:
- 编码观测:把图像或其他观测压缩成模型内部的状态表示;
- 学习潜在动力学:给定当前状态和动作,预测下一个状态,以及奖励、终止或继续信号;
- 在潜空间里 rollout:不必真的与环境交互,直接从当前状态想象出多步未来;
- 更新策略和价值函数:用这些想象轨迹训练 actor、critic 或其他决策模块。
可以把它想成一个“脑内模拟器”:
当前观测 → 内部状态 zₜ
↓ 输入候选动作 aₜ
zₜ → zₜ₊₁ → zₜ₊₂ → zₜ₊₃ → …
↓
预测奖励与长期价值
它不需要把每一步都渲染成清晰的未来视频。只要潜空间里的状态足以判断“会不会撞墙”“能不能拿到奖励”“这条路线值不值得走”,就已经能支持策略学习。
3. DreamerV3 为什么重要
DreamerV3 的论文重点不是再发明一个单独的预测头,而是把一套潜空间世界模型和强化学习训练技术做得更稳健、更通用。论文报告它在多种离散和连续控制任务上使用同一套算法配置,并展示了从零开始在 Minecraft 中获得钻石等结果。官方代码仓库还公开了从约 1M 到 400M 参数量的配置,说明这条路线可以覆盖从小规模实验到更大模型的不同预算。
这类方法的核心优势有三个:
- 样本效率高:很多策略更新可以在想象轨迹上完成,减少真实环境交互;
- 规划成本低:潜状态比完整图像短得多,rollout 不必逐像素生成;
- 更适合动作闭环:奖励、终止和动作后果可以直接写进动力学模型。
它的边界也很明确:潜空间是为任务服务的压缩表示,未必保留所有视觉细节。一个在迷宫导航上很好用的 ,不一定能还原出逼真的光照、纹理或可供人类观看的下一帧;如果压缩时丢掉了细粒度碰撞信息,长时规划还会出现“模型觉得可行,现实却失败”的问题。
三、Genie:把视频变成交互式环境
1. 英文全称与代表论文
Genie 这个名字来自 Generative Interactive Environments。代表论文是 Jake Bruce 等人的 Genie: Generative Interactive Environments,由 Google DeepMind 团队于 2024 年公开;DeepMind 官方研究页给出了论文与项目介绍。
这篇工作最吸引人的地方是:模型可以从没有动作标签的互联网视频中学习。训练数据不必明确告诉模型“这一帧执行了键盘左键”,模型需要自己推断视频中哪些变化可以被解释为潜在动作。
2. Genie 的三块积木
Genie 的原始设计可以粗略拆成三部分:
- 时空视频 tokenizer:把连续视频压缩成更容易建模的视觉 token;
- 自回归动力学模型:根据历史 token 和动作 token 预测后续视觉 token;
- 潜在动作模型:从视频变化中推断“发生了什么动作”,不要求训练集提供真实动作标签。
这让 Genie 不只是“看过很多视频然后续写画面”,还具备了一种交互接口:给它不同的潜在动作,就可能得到不同的未来轨迹。论文报告的 Genie 模型规模为 11B 参数,训练目标是从无标注视频中学习可控的环境动态。
3. 从 Genie 到 Genie 2、Genie 3
后续版本把重点逐渐推向更开放的交互式世界:
- Genie 2强调从单张图像或描述出发生成可交互的 3D 世界,并让智能体在其中行动;
- Genie 3在 2025 年公开介绍中展示了从文字提示生成动态环境的方向,官方给出的展示规格包括 24 帧/秒和 720p,并强调了几分钟尺度上的场景一致性。
这里要特别注意:Genie 2、Genie 3 是不断演进的模型系列,不能把不同版本的演示指标、参数量和训练数据简单相加。公开介绍中已经足够支持“实时交互式视觉世界”这个判断,但具体参数规模、训练语料和控制接口仍应以对应版本的官方资料为准。
4. Genie 的强项与代价
Genie 的最大优势是未来可见。研究者可以直接观察模型想象出来的画面,检查它是否理解了物体、空间和动作结果;对于游戏、仿真、数据生成和交互式内容,这种视觉反馈很有价值。
但像素级或视觉 token 级预测也带来更高成本:
- 画面细节多,训练和推理都比纯 latent rollout 更重;
- 视觉上“看起来合理”不代表物理规律长期一致;
- 从潜在动作到真实机器人控制,还需要额外的动作语义、控制频率和安全约束。
因此,Genie 更像一台可以探索的视觉环境生成器,而不必然是开箱即用的机器人策略。
四、JEPA:预测表征,而不是重建每个像素
1. 英文全称与代表论文
JEPA 的英文全称是 Joint Embedding Predictive Architecture,通常译为联合嵌入预测架构。这条路线的出发点与生成式模型不同:世界里有大量细节并不影响语义判断,模型没有必要把未来的每一片纹理、噪声和光照都还原出来。
在视觉领域,最具代表性的早期工作是 Mahmoud Assran 等人的 Self-Supervised Learning from Images with a Joint-Embedding Predictive Architecture,发表于 CVPR 2023;论文的正式版本可以在 CVF Open Access查看,Meta 的官方研究页也给出了项目说明。
I-JEPA 中的 “I” 表示 Image。它的训练目标不是“根据上下文生成被遮挡区域的 RGB 像素”,而是“根据上下文预测目标区域的 embedding”。这就是 JEPA 和普通掩码自编码器、像素级视频生成模型之间最重要的分界。
2. 它为什么可以忽略很多细节
一个简化的 JEPA 结构是:
上下文区域 x_context ──→ context encoder ──→ context embedding
↓ predictor
目标区域 x_target ────→ target encoder ───→ target embedding
↓
让预测 embedding 接近目标 embedding
如果目标区域里有很多无法从上下文确定的细节,比如树叶的具体纹理、相机噪声或光照变化,直接回归像素会迫使模型记住这些不确定因素;预测表征则可以把注意力放在更稳定的结构上,例如物体类别、形状、相对位置和运动趋势。
这并不意味着 JEPA “什么都不预测”。它仍然需要预测有信息的未来,只是把监督目标放在更抽象的表示空间里。抽象程度过高会丢失控制所需的细节,所以表征设计和下游任务适配非常关键。
3. V-JEPA 2:从视频表征走向世界模型
JEPA 路线从静态图像扩展到视频后,开始更直接地触及世界模型问题。Meta 在 2025 年公开的 V-JEPA 2中,把视频理解、未来表征预测和规划联系起来;官方博客给出的信息包括 1.2B 参数、超过 100 万小时的互联网视频预训练,以及使用少于 62 小时机器人视频进行后训练的 V-JEPA 2-AC。论文预印本中还进一步讨论了视频世界模型和机器人规划。
V-JEPA 2 的关键点不是“生成一段高清未来视频”,而是让模型在表征空间中回答:如果执行这个动作,未来的状态 embedding 会怎样变化?这种表示可能更适合做语义理解、可迁移预测和规划;同时,它也意味着如果我们想要人类可见的画面,仍然需要额外的解码器或生成模型。
JEPA 的优势可以概括为:
- 计算目标更聚焦:不必为所有像素细节付出同等代价;
- 表征迁移更自然:同一个视频编码器可以服务于识别、检索、预测和规划;
- 更容易避开无关噪声:遮挡、光照和纹理变化不一定会主导训练目标。
它的挑战则是:抽象表征是否保留了动作后果,需要用控制、规划和长时预测任务验证;而且真正的动作接口往往需要额外的 action-conditioned 模块或后训练阶段。
五、把三条路线放在一起看
下面这张图把三种方法的“预测对象”和“控制接口”放在同一张画布里:
| 路线 | 主要预测对象 | 动作在模型中的位置 | 最适合的问题 | 主要代价 |
|---|---|---|---|---|
| Dreamer | 潜状态、奖励、继续信号 | 通常显式输入动力学模型 | 在环境里规划和学习策略 | 潜状态可能丢失视觉细节,长时 rollout 会累积误差 |
| Genie | 未来视觉 token 或画面 | 潜在动作驱动视觉动态 | 生成可交互环境、观察未来 | 视频建模和解码成本高,视觉合理不等于物理可靠 |
| JEPA | 未来或目标区域的 embedding | 可先做表征预训练,再通过动作后训练接入 | 学习可迁移的视觉/视频表示与预测 | 不直接输出画面,是否保留控制细节要靠任务验证 |
可以用一个 3×3 patch 网格来理解这个差别:
- Dreamer 关心的是“从当前状态走哪一步,未来价值更高”;
- Genie 关心的是“走这一步之后,画面会怎么变化”;
- JEPA 关心的是“走这一步之后,场景的语义和结构表征会怎么变化”。
三者都可以使用图像和视频,但训练信号并不一样。不要因为它们都出现了 latent、prediction 或 world model 这些词,就默认它们能互相替换。
六、一个共同原则:只预测真正有用的变化
三条路线虽然目标不同,却共享一个很重要的直觉:预测不是越多越好,而是要把容量用在会影响决策的变化上。
Dreamer 通过潜空间压缩掉不影响奖励的视觉细节;Genie 需要在保留可交互结构的同时控制视觉生成成本;JEPA 则直接把目标放在表征空间,主动绕开许多不可预测或无关的像素细节。
这也解释了为什么“世界模型越逼真越好”并不总成立。一个在像素上很漂亮的模型,可能把大量容量花在背景纹理上,却没有学会动作会不会导致碰撞;一个画面模糊的 latent model,反而可能更适合策略优化。
如果想让视觉预测对扰动更稳健,可以参考一些相邻方向的训练思想。例如 NeurIPS 2025 的 NoisyRollout: Reinforcing Visual Reasoning with Data Augmentation采用逐步退火的视觉扰动,让模型在训练中同时接触干净和带噪输入。它是一篇视觉推理增强论文,并不是 Dreamer、Genie 或 JEPA 的组成部分;但“先学会在扰动中保持任务相关结构,再逐渐收紧噪声”的思路,可以作为设计视觉世界模型鲁棒性实验时的参考。
七、工程上到底怎么选
可以先问四个问题:
-
你需要看到未来画面吗?
- 需要做交互式环境、游戏世界或数据生成,优先研究 Genie 类生成模型;
- 只要动作价值和状态转移,没必要从一开始就做像素级生成。
-
模型要不要直接参与动作闭环?
- 如果需要在仿真器或机器人环境中快速试验策略,Dreamer 类潜空间 rollout 往往更直接;
- 如果先做通用视觉预训练,JEPA 类表示可以作为感知和预测底座,再接动作条件模块。
-
评价指标到底是什么?
- 生成路线要看画面质量之外的时序一致性、可控性和物理合理性;
- 潜空间路线要看真实环境回报、样本效率、长时预测误差和策略稳定性;
- 表征路线要看线性探测、迁移、动作条件预测和规划成功率,不能只看重建图像。
-
计算预算能承受哪一种误差?
- 预算有限时,先做 latent dynamics 或表征预测,通常更容易迭代;
- 只有在画面可视化和交互本身是产品目标时,才值得承担高分辨率视频生成的成本。
一个非常实用的混合方案是:**用 JEPA 风格的视觉编码器提取稳定表征,用 Dreamer 风格的潜动力学做 rollout,再按需要外挂 Genie 风格的视觉解码器。**这不是三篇论文直接拼装出来的标准答案,而是一种把“感知、预测、规划、可视化”拆开设计的工程思路。
八、最后总结
把三条路线压缩成三句话:
- Dreamer:我不需要把未来画得很清楚,只要在潜空间里准确判断动作后果,就能规划和学习;
- Genie:我希望未来是可见、可交互的,所以要生成连续的视觉世界;
- JEPA:我更关心未来的语义和结构表征,不想为每个不可预测的像素细节买单。
世界模型真正的难点,不是给模型起一个更大的名字,而是决定什么信息必须预测、什么信息可以丢掉,以及预测误差怎样影响最终决策。理解了这一点,再看 Dreamer、Genie 和 JEPA,就不会把“潜空间想象”“视频生成”和“表征预测”混成一件事。
参考资料
- Dream to Control: Learning Behaviors by Latent Imagination(OpenReview)
- Mastering Diverse Domains through World Models(arXiv) · Nature 正式论文 · DreamerV3 官方代码
- Genie: Generative Interactive Environments(arXiv) · DeepMind 官方研究页
- Genie 2 官方介绍 · Genie 3 官方介绍
- I-JEPA:Self-Supervised Learning from Images with a Joint-Embedding Predictive Architecture(CVPR 2023)
- V-JEPA 2 官方研究页 · 论文预印本
- NoisyRollout(NeurIPS 2025)