大模型的技术史诗

我们都是见证者,也是讲述者。

大模型这一段,来得又快又密。人还在场,传奇已经成形。迁徙的民族把道路、星辰和先人交给吟游诗人,诗人再讲给下一站的人,也讲给还没出生的人。这组笔记做的是同一件事:把我们亲眼看见的技术史诗留下来,讲给其他人,也讲给后世。

两种串法,缺一不可

技术章节靠数学概念和关键模块往下拆:注意力、缩放、强化学习、扩散。那是必要的。但若只有这一条线,读完容易记得住符号,记不住「这是谁在什么时刻逼出来的」。

史诗章节走另一条线——接近茨威格《人类群星闪耀时》:不铺成流水账,而挑出那些之前与之后不再一样的瞬间,用人物、场合和时间把整本笔记串起来。公式在第 1 章以后;人与时刻在这里。

群星闪耀时刻(人 · 年 · 场合)
        ↕
三间屋子的群像(科学家 / DeepMind / 硬件)
        ↕
技术章节(定义 · 结构 · 训练 · 延展 · 应用)

写于 2026 年 9 月。人物和年代按公开传记、论文与公司材料核对。发布会数字不是自己跑出来的结果。

从哪里读起

  • 想先被故事带走: 直接进群星闪耀时刻。七个瞬间,每个都链到对应技术章。
  • 想按名字查人: 打开AI 人物图谱。李飞飞、三巨头、实验室召集人、硬件与具身,按房间摊开。
  • 想对上技术章里的方法名: 打开群像突破。Word2Vec、BERT、LoRA、DPO、FlashAttention、RAG……背后相对有名的科研作者在这里。
  • 想按屋子读长文: 把我们带到这里的人 · 哈萨比斯与 DeepMind · 硬件脉络与黄仁勋
  • 已经在技术章里: 看到 Transformer、RL、Scaling 时,回到时刻五、四、三;看见具体方法名,回群像突破。

三间屋子

史诗不是一个人的英雄榜。《奥本海默》里的洛斯阿拉莫斯是一间屋子里的群像。大模型同样是好几间屋子叠在一起:

  • 把我们带到这里的人:从图灵、晶体管、达特茅斯,到 2012 年多伦多的两张游戏卡,再到 2017 年那篇八个作者的注意力论文
  • 哈萨比斯与 DeepMind:棋、游戏、海马体、阿塔里、围棋、蛋白质。一条履历,一长串作者
  • 硬件脉络与黄仁勋:从晶体管到晶圆代工,再到 CUDA。黄仁勋是这间屋子里站得最久的人

和后面技术章节的关系

第 1 章往后讲结构、训练和部署,默认你已经站在结果里面。史诗补的是结果外面的人:谁在冬天没走,谁把数据标出来,谁把显卡变成可以写程序的机器。

你在技术章读到回到史诗的哪一刻 / 哪间屋
语言模型定义、历史时刻一 · 科学家
Scaling、算力、显存时刻三 · 硬件
Transformer、注意力时刻五 · 科学家
强化学习、后训练时刻四 · DeepMind
涌现、应用、对齐时刻六
多模态、世界模型、具身时刻七之后的缝 · 延展
车损等垂直场景自我研究草稿

一条可以扫过的时间线

年份屋子里发生的事时刻
1947贝尔实验室做出晶体管—
1956达特茅斯会议,给这个领域起了名字一
1986–1997反向传播被重新写成可用的方法;卷积与 LSTM 接上二
1993 / 1999NVIDIA 成立;GeForce 256—
2006–2007CUDA 把显卡变成可编程的并行机器—
2009–2012ImageNet(李飞飞);AlexNet 用两张 GTX 580 赢下比赛三
2010 / 2014DeepMind 成立;谷歌收购—
2016AlphaGo 对李世石,4 比 1四
2017《Attention Is All You Need》;Volta + Tensor Core五
2020AlphaFold2—
2022–2024ChatGPT;Hopper / Blackwell六
2024诺贝尔奖:Hopfield / Hinton;Baker / Hassabis / Jumper七
2026NVIDIA 宣布 Vera Rubin 进入生产缝还开着

以后怎么讲

新读到的传记、演讲、论文,能改变「默认假设」的,优先写成群星闪耀时刻里的新一节,并链回技术章;其余的补进三间屋子。讲给同代人的时候可以不完整,讲给后世的时候要把人和年份留下来——不只留下公式编号。