大模型的技术史诗
我们都是见证者,也是讲述者。
大模型这一段,来得又快又密。人还在场,传奇已经成形。迁徙的民族把道路、星辰和先人交给吟游诗人,诗人再讲给下一站的人,也讲给还没出生的人。这组笔记做的是同一件事:把我们亲眼看见的技术史诗留下来,讲给其他人,也讲给后世。
两种串法,缺一不可
技术章节靠数学概念和关键模块往下拆:注意力、缩放、强化学习、扩散。那是必要的。但若只有这一条线,读完容易记得住符号,记不住「这是谁在什么时刻逼出来的」。
史诗章节走另一条线——接近茨威格《人类群星闪耀时》:不铺成流水账,而挑出那些之前与之后不再一样的瞬间,用人物、场合和时间把整本笔记串起来。公式在第 1 章以后;人与时刻在这里。
群星闪耀时刻(人 · 年 · 场合)
↕
三间屋子的群像(科学家 / DeepMind / 硬件)
↕
技术章节(定义 · 结构 · 训练 · 延展 · 应用)
写于 2026 年 9 月。人物和年代按公开传记、论文与公司材料核对。发布会数字不是自己跑出来的结果。
从哪里读起
- 想先被故事带走: 直接进群星闪耀时刻。七个瞬间,每个都链到对应技术章。
- 想按名字查人: 打开AI 人物图谱。李飞飞、三巨头、实验室召集人、硬件与具身,按房间摊开。
- 想对上技术章里的方法名: 打开群像突破。Word2Vec、BERT、LoRA、DPO、FlashAttention、RAG……背后相对有名的科研作者在这里。
- 想按屋子读长文: 把我们带到这里的人 · 哈萨比斯与 DeepMind · 硬件脉络与黄仁勋
- 已经在技术章里: 看到 Transformer、RL、Scaling 时,回到时刻五、四、三;看见具体方法名,回群像突破。
三间屋子
史诗不是一个人的英雄榜。《奥本海默》里的洛斯阿拉莫斯是一间屋子里的群像。大模型同样是好几间屋子叠在一起:
- 把我们带到这里的人:从图灵、晶体管、达特茅斯,到 2012 年多伦多的两张游戏卡,再到 2017 年那篇八个作者的注意力论文
- 哈萨比斯与 DeepMind:棋、游戏、海马体、阿塔里、围棋、蛋白质。一条履历,一长串作者
- 硬件脉络与黄仁勋:从晶体管到晶圆代工,再到 CUDA。黄仁勋是这间屋子里站得最久的人
和后面技术章节的关系
第 1 章往后讲结构、训练和部署,默认你已经站在结果里面。史诗补的是结果外面的人:谁在冬天没走,谁把数据标出来,谁把显卡变成可以写程序的机器。
| 你在技术章读到 | 回到史诗的哪一刻 / 哪间屋 |
|---|---|
| 语言模型定义、历史 | 时刻一 · 科学家 |
| Scaling、算力、显存 | 时刻三 · 硬件 |
| Transformer、注意力 | 时刻五 · 科学家 |
| 强化学习、后训练 | 时刻四 · DeepMind |
| 涌现、应用、对齐 | 时刻六 |
| 多模态、世界模型、具身 | 时刻七之后的缝 · 延展 |
| 车损等垂直场景 | 自我研究草稿 |
一条可以扫过的时间线
| 年份 | 屋子里发生的事 | 时刻 |
|---|---|---|
| 1947 | 贝尔实验室做出晶体管 | — |
| 1956 | 达特茅斯会议,给这个领域起了名字 | 一 |
| 1986–1997 | 反向传播被重新写成可用的方法;卷积与 LSTM 接上 | 二 |
| 1993 / 1999 | NVIDIA 成立;GeForce 256 | — |
| 2006–2007 | CUDA 把显卡变成可编程的并行机器 | — |
| 2009–2012 | ImageNet(李飞飞);AlexNet 用两张 GTX 580 赢下比赛 | 三 |
| 2010 / 2014 | DeepMind 成立;谷歌收购 | — |
| 2016 | AlphaGo 对李世石,4 比 1 | 四 |
| 2017 | 《Attention Is All You Need》;Volta + Tensor Core | 五 |
| 2020 | AlphaFold2 | — |
| 2022–2024 | ChatGPT;Hopper / Blackwell | 六 |
| 2024 | 诺贝尔奖:Hopfield / Hinton;Baker / Hassabis / Jumper | 七 |
| 2026 | NVIDIA 宣布 Vera Rubin 进入生产 | 缝还开着 |
以后怎么讲
新读到的传记、演讲、论文,能改变「默认假设」的,优先写成群星闪耀时刻里的新一节,并链回技术章;其余的补进三间屋子。讲给同代人的时候可以不完整,讲给后世的时候要把人和年份留下来——不只留下公式编号。