5. 延展:从语言模型长出来

先讲故事

第 1–4 章与第 6 章走的是语言模型主线:从命名、冬天、赛场与卧室,到 Attention、后训练、智能体,再到算力集群上的推理。第 5 章要讲的是主线旁边仍开着的缝——预测的骨架还在,变的是序列里装什么,以及推出来的东西用来干什么。侧栏序号上它夹在智能体与部署之间:能力先长出来,再谈怎么堆集群伺候它。

看:多模态不是「再训一个 GPT」那么简单

语言模型吃文本 token。要把图像接进去,历史上走出几条清楚的路:Radford 等人的 CLIP 把图和文拉到同一空间;DeepMind 的 Flamingo 用交叉注意力让冻结的 LM「看见」;刘海超等人的 LLaVA 把视觉特征投影成 LM 能读的前缀 token。GPT-4V、Gemini、GPT-4o 则被公司描述为更原生的多模态——配方未全公开,故事记在多模态与群像突破。

做:生成是另一条河

看懂与做出来不是同一件事。Goodfellow 的 GAN、Ho 的 DDPM、Rombach 的潜扩散、Peebles 与 Xie 的 DiT,把「从噪声走向图像」写成工业默认;视频与 3D(NeRF、高斯泼溅)再把时间与几何加进来。生成

推:世界模型这个词要先拆开

知识章节里「文本里的世界模型」,指常识;本延展里的世界模型,要求状态 + 动作 → 下一状态。David Ha 与 Schmidhuber 2018 年的梦、杨立昆的 JEPA、Genie / Cosmos,以及李飞飞 World Labs 所推的空间智能,是同一道缝上的不同工事。世界模型 · 时刻七之后

动:具身仍未解决

眼睛与推演若不能变成关节上的泛化控制,智能就还停在屏幕里。RT-2、π0、GR00T 是认真的尝试;换房间、换本体、长程与接触,仍是开放问题。具身

读完故事再进本节

文本 token  ──►  下一个文本 token          语言模型(第 1–3 章)
图像 / 声音 / 视频 token  ──►  文本或别的模态    多模态大模型
状态 + 动作  ──►  下一状态                  世界模型
文字或参考图  ──►  图片、视频、三维表示        多模态生成
观测 + 语言指令  ──►  机器动作              具身智能(尚未解决)

人物与时间线:群星闪耀时刻 · 人物图谱 · 群像突破 · 延展。

写于 2026 年 9 月。结构按论文和公司公开说明来记。未公开的训练配方只记到「他们这样描述」,不把发布会写成已经核对过的实验。

先记住这一张图

上面的五条箭头,就是本节的地图。前三条线共用序列模型,最常见的还是 Transformer。生成这一支里,早期的 DALL-E 仍在预测下一个视觉 token;2022 年之后的主流改成在潜空间里去噪,或沿着一条从噪声到数据的流走。骨干从 U-Net 换成扩散 Transformer 之后,缩放方式又和语言模型碰到一起。交叉注意力、嵌入这些零件在结构里已经有了。

四节怎么读(5.1–5.4)

  • 5.1 多模态大模型:视觉编码器、连接器、冻结的语言模型。CLIP、Flamingo、BLIP-2、LLaVA,以及后来声称原生多模态的模型
  • 5.2 世界模型:和「模型从文本里懂了一些世界」不是同一个词。这里记的是能往前推演的模型:Ha 与 Schmidhuber、JEPA、在梦里训练策略、视频生成被叫做世界模拟器的那一支
  • 5.3 多模态生成:把图片、视频和 3D 做出来。潜空间扩散、DiT、以及 NeRF、高斯泼溅这两类三维表示
  • 5.4 具身智能:智能能不能泛化到控制机器。视觉-语言-动作模型是现在的尝试,泛化本身还没有被解决

和旧笔记里两个词的关系

知识表示里已经用过「世界模型」,指语言模型从文字里形成的隐式常识。那个用法留下。延展里的世界模型多了一个要求:给定动作,下一状态要能被推出来,并且最好能在推出来的世界里试错。

DeepMind那一页的 MuZero、AlphaGo,是世界模型在棋类里的近亲:先有一个可以推演的模型,再在里面搜索。读完延展可以回去对一下。

以后怎么补

每一节末尾有「还想补」。新模型先写进时间线,再决定它是换了连接器、换了预测目标,还是换了生成表示。连接器变了,多模态那页加一行。预测目标从 token 变成状态,世界模型那页加一行。图片、视频、3D 的做法变了,生成那页加一行。一台机器在新房间里做成了一件没演示过的事,具身那页记下来,并写明机器人、光照和物体有没有换。

Keep Hungry · 大模型笔记