群星闪耀时刻
茨威格写《人类群星闪耀时》,不是编年史年表,而是挑出那些「之前与之后不再一样」的瞬间:华伦斯坦的一夜、滑铁卢的一分钟、南极的最后一段路。大模型这边同样有这样的瞬间。公式在技术章里;这一页只讲人、场合,以及那一刻之后世界怎么变了。
读法:先读时刻,再顺着「技术章入口」下去。也可以反过来——在公式里走不动时,回到这一页,看看它是谁在哪一年逼出来的。
时刻一览
| 时刻 | 年份 | 站在场上的人 | 之后不一样的地方 |
|---|---|---|---|
| 达特茅斯的夏天 | 1956 | 麦卡锡、明斯基、香农…… | 这个领域有了名字 |
| 反向传播回到桌上 | 1986 | 鲁梅尔哈特、辛顿、威廉姆斯 | 深层网络重新变得可训练 |
| ImageNet 的赛场与多伦多的卧室 | 2009–2012 | 李飞飞搭赛场;克里热夫斯基、苏茨克维、辛顿在赛场上赢;卡背后是黄仁勋 | 数据成为基础设施;深度学习赢过主流视觉 |
| 首尔的五番棋 | 2016 | 哈萨比斯、西尔弗、李世石…… | 强化学习与自我对弈被全世界看见 |
| 八个作者的标题 | 2017 | Vaswani 等八人 | 序列模型的默认骨架换成 Transformer |
| 实验室的门打开 | 2022 | OpenAI 实验室外的亿级用户 | 大模型从论文走进日常 |
| 斯德哥尔摩的两张奖 | 2024 | 霍普菲尔德、辛顿;贝克、哈萨比斯、江珀 | 寒冷年代的线被写进诺贝尔史 |
时刻一:达特茅斯的夏天
1956 年夏天,约翰·麦卡锡把一群人叫到新罕布什尔的达特茅斯。前一年的提案里,他们给这件事起名叫 artificial intelligence。马文·明斯基、克劳德·香农、纳撒尼尔·罗切斯特在场。名字先于能力。房间里的人相信:学习、语言、抽象,原则上都可以被机器做出来。
那不是一次「发明神经网络」的会议。它的力量在于命名与召集:此后三十年的经费、冬天、争论,都绕着这个名字转。
时刻二:反向传播回到桌上
1986 年,戴维·鲁梅尔哈特、杰弗里·辛顿、罗纳德·威廉姆斯把误差一层一层往回传的方法,重新写成一批人会用的工具。更早的人已经碰过这个想法。1986 年的意义是:它再次站上桌面。
神经网络在感知机被批评之后进过冬天。这一刻没有立刻带来今天的大模型,但它让「深层」重新合法。杨立昆的卷积、霍赫赖特与施米德胡伯的 LSTM,都在这条解冻的河岸上往前走。
技术章入口: 语言模型历史 · 训练方法 · 群像里的冬天里没有散场的人
时刻三:ImageNet 的赛场与多伦多的卧室
故事常被说成「两张游戏卡赢了比赛」。更完整的说法是:李飞飞先把赛场搭起来,卧室里的人再在赛场上赢。
2007 年前后,李飞飞在普林斯顿判断:视觉缺的不是又一个手工特征,而是一张大到能把算法比出高下的标注图。ImageNet 按 WordNet 层级组织类别,靠众包标出逾千万图像,2009 年公开,ILSVRC 成为赛场。头几年传统计算机视觉仍赢。没有这张图,后面的转折没有观众席,也没有裁判。
2012 年,亚历克斯·克里热夫斯基在父母家的卧室里,用两张 NVIDIA GTX 580 训练了后来叫做 AlexNet 的网络。伊利亚·苏茨克维认定这件事该做,辛顿是导师。他们在 ImageNet 上把传统方法甩开一大截。同一年,黄仁勋的公司已经把 CUDA 押了六年。游戏卡第一次被全世界的视觉研究者当成科学仪器。
辛顿后来说:Ilya 觉得该做,Alex 做成了,奖给了我。图谱里还要补上第四句:赛场是李飞飞搭的。
李飞飞后来任斯坦福 SAIL 主任、HAI 共同创办人,并创办 World Labs,把「空间智能 / 世界模型」推成下一道缝。人名与贡献表见AI 人物图谱 · 李飞飞专节。
技术章入口: Scaling · 硬件与黄仁勋 · 世界模型 · 科学家
时刻四:首尔的五番棋
2016 年 3 月,首尔。DeepMind 的 AlphaGo 对李世石,五番棋,4 比 1。哈萨比斯是实验室的召集人,大卫·西尔弗领衔算法,黄士杰把程序的落子摆到实棋上。第二局的第 37 手像落错了地方;第四局李世石下出「神之一手」。
两亿人次看过转播。强化学习、自我对弈、搜索,从论文里的词变成棋盘上的一手。游戏仍是显微镜;显微镜后面是科学。
技术章入口: 强化学习 · 后训练 · 哈萨比斯与 DeepMind
时刻五:八个作者的标题
2017 年,谷歌的八个作者发表《Attention Is All You Need》:Vaswani、Shazeer、Parmar、Uszkoreit、Jones、Gomez、Kaiser、Polosukhin。标题像一句口号,作者列表本身就是群像。
循环网络一步一步走时间;注意力让训练更可并行。后面的 BERT、GPT,以及今天所有「大模型」默认骨架,都站在这篇论文上。同年,NVIDIA 的 Volta 带上 Tensor Core——结构与芯片再次同岁。
技术章入口: Transformer · 自注意力 · 结构拆解
时刻六:实验室的门打开
2022 年 11 月前后,ChatGPT 把对话界面推到实验室外面。论文里的 in-context learning、指令跟随,变成上亿人会用的产品动作。苏茨克维等人参与的那条从 AlexNet 到大规模预训练的线,在这一刻碰到了非研究者。
涌现、对齐、应用开发,从此不再只是研讨会词汇。你笔记里的第 4 到第 7 章,很多问题是从这个月之后才长出「必须写下来」的理由。
时刻七:斯德哥尔摩的两张奖
2024 年,诺贝尔物理学奖给了约翰·霍普菲尔德与杰弗里·辛顿,表彰人工神经网络的基础工作。化学奖的一半给了戴维·贝克,另一半由德米斯·哈萨比斯与约翰·江珀共享,表彰蛋白质结构预测。
冬天里留在桌边的人,和把游戏公司做成科学实验室的人,被写进同一年的授奖词。奖不是故事的结尾——它把「这件事曾经不可置信」写进了公共记忆。
技术章入口: 科学家群像 · DeepMind 与 AlphaFold · 延展:多模态与世界模型
时刻之后:仍在闪耀的缝
茨威格的书停在已经完成的瞬间。我们的史诗还没有停。下面这些缝,人物已到场,结局未写完:
| 缝 | 在场的人与方向 | 笔记入口 |
|---|---|---|
| 多模态与生成 | 视觉编码器接上语言模型;扩散与 DiT 做图、视频、3D | 延展 |
| 世界模型 | Ha、Schmidhuber;杨立昆的 JEPA;Genie / Cosmos | 世界模型 |
| 具身智能 | RT-2、π0、GR00T……泛化控制仍未解决 | 具身智能 |
| 垂直现场 | 例如车损三维重构:CrashSplat、CarDD、定损产业 | 车损三维重构 |
怎么用这一页串章节
- 先人后式: 从上表挑一个时刻 → 读人物页 → 再进技术章。
- 先式后人: 在公式里卡住 → 回到本页找「是谁在什么场合需要这个式子」。
- 自己补第八个时刻: 新论文、新发布若真的改变了默认假设,写成新的一节,并链到技术章。不要只改年份表。