世界模型
「世界模型」在这套笔记里有两个意思,先分开。
知识表示里的世界模型,是语言模型从文本里学到的隐式常识:水会往低处流,人开门要先转动把手。它没有一双眼睛,也没有一个可以按下去的动作。
这一页的世界模型多一个结构:有状态,有动作,模型负责推出下一状态。推得足够好,策略就可以在模型里试错,再回到真实环境。多模态模型提供看见世界的办法。世界模型要求看见之后还能往前推。
杨立昆在 2022 年的路线图里把这件事说得很硬:只预测下一个词,还不算掌握了世界如何随行动变化。这页把他的反对和「语言模型可以长成世界模型」放在一起。两边都先记下来。
2018 年那篇把名字定下来的论文
David Ha 和于尔根·施米德胡伯在 NeurIPS 2018 发表《Recurrent World Models Facilitate Policy Evolution》,交互版在 worldmodels.github.io。模型拆成三块:
- V:把像素压进一个小的隐向量
- M:一个循环网络,在隐空间里预测接下来会怎样
- C:一个很小的控制器,根据 V 和 M 的输出选择动作
他们可以只在 M 生成的「梦」里训练 C,再把策略放回真实环境。赛车和 Doom 上,这套办法走通了。论文自己也写了限度:梦如果有破绽,控制器会利用破绽。他们用温度把梦调得更不确定,减少这种钻空子。
这三块就是后来所有「世界模型」口号要回到的清单。生成画面的模型如果没有动作进得去、下一状态出得来、策略能在里面训练,它更接近多模态生成,而不是这一页的定义。
和语言模型接上的地方
语言模型做的是:上文进去,下一个 token 出来。世界模型做的是:当前隐状态和动作进去,下一个隐状态出来。把隐状态也当成一种 token,预测头可以仍是 Transformer。
所以它是延展,而且延展的是预测目标:
- 词:下一个词
- 图块或视频隐变量:下一帧长什么样
- 状态:做了这个动作之后,世界变成什么样
第三条必须把动作放进条件。没有动作的视频模型,会把看起来合理的未来生成出来,但你不能问它「如果我向左转」。Sora 在 2024 年 2 月被 OpenAI 写成 video generation models as world simulators。画面怎么被做出来,写在多模态生成。它当时公开的用法是按文本生成视频,动作条件的交互还没有成为那个产品的定义。笔记里把它记成通向世界模拟器的生成模型,不把它直接写成 Ha 和 Schmidhuber 那种可以在梦里训策略的世界模型。
几条后来的线
在模型里规划。 Dreamer 一系(Hafner 等人,约 2019 年起)在学到的隐动态里想象轨迹,再用想象出来的回报训练策略。DeepMind 的 MuZero 则在棋类里学习一个用于搜索的模型,规则不必事先写死。那一页的故事在哈萨比斯与 DeepMind。世界模型和强化学习在这里是同一间屋子。
预测表示,而不是像素。 杨立昆 2022 年的《A Path Towards Autonomous Machine Intelligence》提出 JEPA:在表征空间里预测被遮住或尚未发生的部分,不去重建每一个像素。像素空间的预测会把精力耗在纹理上。I-JEPA、以及面向视频的 V-JEPA,是这条线的后续。他的判断是:语言模型、甚至按像素生成的视频模型,都还缺少一个会随行动更新的抽象世界模型。
从无标注视频里长出可交互的环境。 DeepMind 的 Genie(2024)从大量没有动作标签的视频里,既学习画面如何演变,也学习一套可控制的潜在动作。人可以在生成出来的环境里操作。后续的 Genie 2,以及 2025 年公开的下一代,把可交互环境做得更长、更实时。具体能力以当时的技术报告为准,这页先记下任务定义:世界要能被动作改变。
给物理 AI 用的基础模型。 2025 年 CES,NVIDIA 发布 Cosmos,称为 world foundation models,面向驾驶、机器人和工业场景里的视频预测与仿真。它和黄仁勋那条硬件线接在一起:世界模型一旦要吃下大量真实视频,训练它的还是那一页里的集群。发布稿里的数据规模先当作公司主张。等有独立复现,再写进这页的数字。
一张对照,避免以后混用
| 说法 | 输入 | 输出 | 能在里面试错吗 |
|---|---|---|---|
| 文本里的世界模型 | 文字 | 下一个词、一段常识 | 不能按动作改世界 |
| 多模态大模型 | 图、声、文 | 通常仍是文字或另一种模态 | 看懂,不负责推演干预 |
| 可推演的世界模型 | 状态,加上动作 | 下一状态 | 这是这一页的标准 |
| 视频生成被称作模拟器 | 文本或开头几帧 | 一段看起来合理的视频 | 要另看它接不接受动作 |
把下一状态真正变成关节和夹爪的指令,是具身智能。那一页记下的是:这件事到 2026 年还没有被解决。
还想补
- 把 Ha 和 Schmidhuber 的 V、M、C 用一张自己画的框图放在这里,标出哪一块后来被 Transformer 换掉。
- 选一个很小的环境(比如倒立摆或二维赛车),只在学到的模型里训练策略,记录梦和真实环境的差距。
- 读到新的「世界模型」发布时,先填上面那张表的四列,再决定写进哪一节。