多模态生成

多模态大模型负责看懂。这一页负责做出来:文字、参考图或一段视频进去,图片、视频或三维物体出来。语言模型在这里常常退到条件的位置,负责把提示词编成向量。真正把像素或三维表示变出来的,是另一套生成模型。

写于 2026 年 9 月。产品名字换得很快,下面记的是表示和训练目标。发布会里的画质排名不写进这页,等自己跑过再补。

图片

2021 年的 DALL-E 还很像语言模型:先把图像压成离散视觉 token,再用 Transformer 按顺序预测下一个 token。能做,但序列长,一次只能认真生成不大的图。

2020 年 Ho 等人的 DDPM 换了一条路。训练时往图上加噪声,模型学习把噪声预测出来,再减掉。采样就是从纯噪声出发,反复去噪。2022 年这条路进入潜空间,成为后来大多数产品的底子。Rombach 等人的潜扩散(Latent Diffusion,也就是 Stable Diffusion 的论文)把生成拆成三块:

  • 一个自编码器把图像压进更小的潜变量,扩散不在像素上做
  • 一个 U-Net 在潜空间里去噪
  • 文本编码器(Stable Diffusion 用 CLIP,Imagen 用 T5)通过交叉注意力告诉 U-Net 这句话在说什么

无分类器引导(classifier-free guidance)是使用时的旋钮:采样时把「有文本」和「没有文本」的预测拉开,提示词就更听话,拉得太开画面会发脆。

2023 年 Peebles 和 Xie 的 DiT 把 U-Net 换成 Transformer,输入是潜空间里的图块。他们按计算量往上加深度和宽度,FID 跟着下降。扩散模型从此可以用和语言模型相似的方式谈缩放。

2024 年的 Stable Diffusion 3 在 DiT 上做成 MMDiT:文本和图各自有一套权重,注意力时两条序列合在一起看。训练目标改成整流流(rectified flow,Lipman、Liu、Albergo 等人 2022 年的工作)。噪声和数据之间走一条更直的路径,采样步数可以更少。同年 Black Forest Labs 放出 Flux.1,核心团队来自 Stable Diffusion,公开资料里是大约 120 亿参数的多模态扩散 Transformer,同样用流匹配。

日常使用里还有两件外挂,不改变上面的骨架。ControlNet(Zhang 等人,2023)把深度、姿势、边缘作为额外条件,不必重训整个模型。LoRA 则把一种风格收成一小包权重。

视频

视频是加上时间的图像。帧与帧如果各画各的,人物和背景会闪。2022 年的 Make-A-Video、Imagen Video 在图像模型上增加时间层。2023 年的 Stable Video Diffusion 把图像扩散模型用视频数据继续训,让注意力同时看空间和时间。

2024 年 2 月的 Sora 把视频切成时空图块,送进扩散 Transformer。技术细节属于这一页。它算不算世界模型,属于世界模型:当时公开的用法是按文本生成一段视频,动作还不能当作条件送进去。

到 2026 年,Runway、可灵、Luma、Veo、海螺这些产品线都在换版本。读一个新模型时先填四格,再决定要不要记进时间线:

要问的事为什么重要
在像素上生成,还是在潜空间里生成决定分辨率和显存
时间怎么切成 token决定能做多长、会不会闪
第一帧或参考图锁不锁得住决定能不能做图生视频
镜头和动作是不是条件决定它只是一段影片,还是能接上世界模型

视频 token 比单张图多一个量级。训练和推理的账单回到硬件脉络。

3D

三维先选表示,再谈怎么生成。三种表示足够覆盖现在要读的论文:

表示代表适合记住的特点
网格游戏和建模软件里的三角面下游最好用,直接优化很难
神经辐射场 NeRFMildenhall 等人,ECCV 2020沿射线查询密度和颜色。质量高,渲染慢
三维高斯泼溅Kerbl 等人,SIGGRAPH 2023一堆带方向的高斯椭球,可以实时光栅化

拿到一个三维物体有两条路。

第一条是从照片重建。多张校准过的照片可以拟合 NeRF 或一堆高斯。NVIDIA 的 Instant-NGP(2022)把 NeRF 的训练从小时级压到分钟级。高斯泼溅则把交互式查看变成常态。

第二条是从文字或单张图生成。DreamFusion(Poole 等人,2022)没有三维训练集:它优化一个 NeRF,让随机视角渲染出来的图,看起来像一个冻结的二维扩散模型会画出的图。这个办法叫分数蒸馏。它慢,也容易出现多张脸贴在同一个物体上的问题。2023 年的 LRM 改成前馈:网络一次前向就从图像预测三维表示,不再为每个物体单独优化。2024 到 2026 年的图生三维产品,大多是这条线的工程化,输出网格或高斯,耗时从小时变成秒到分钟。具体一家的精度,用自己的物体测过再写。

和另外两页怎么分

  • 看懂图、按指令回答:留在多模态大模型。
  • 做出来:留在这一页。文本编码器仍是 CLIP 或 T5,所以语言模型没有离开,它负责条件。
  • 做出来的视频如果还能回答「我做了这个动作之后呢」:再抄一份到世界模型。生成模型先把未来画得像样,世界模型还要求未来跟着动作变。
  • 这些画面和三维如果要拿去驱动一台真实的机器:去具身智能。那一页的问题还开着。
  • 车损现场、定损定责这类垂直问题:去自我研究草稿 · 车损三维重构。

还想补

  • 跑一次潜扩散,记下像素尺寸和潜变量尺寸。压缩倍数是这页最值得自己测的一个数。
  • 同一句提示词,比较 U-Net 的旧 Stable Diffusion 和一个 DiT 模型,只写文字渲染和结构有什么差别。
  • 选一个小物体,用手机拍一圈,建成高斯泼溅。记下训练时间和转动视角时的帧率。