群星闪耀时刻

茨威格写《人类群星闪耀时》,不是编年史年表,而是挑出那些「之前与之后不再一样」的瞬间:华伦斯坦的一夜、滑铁卢的一分钟、南极的最后一段路。大模型这边同样有这样的瞬间。公式在技术章里;这一页只讲人、场合,以及那一刻之后世界怎么变了。

读法:先读时刻,再顺着「技术章入口」下去。也可以反过来——在公式里走不动时,回到这一页,看看它是谁在哪一年逼出来的。

写于 2026 年 9 月。每个时刻只保留决定性细节。查人名用AI 人物图谱。长群像在把我们带到这里的人、DeepMind、硬件与黄仁勋。

时刻一览

时刻年份站在场上的人之后不一样的地方
达特茅斯的夏天1956麦卡锡、明斯基、香农……这个领域有了名字
反向传播回到桌上1986鲁梅尔哈特、辛顿、威廉姆斯深层网络重新变得可训练
ImageNet 的赛场与多伦多的卧室2009–2012李飞飞搭赛场;克里热夫斯基、苏茨克维、辛顿在赛场上赢;卡背后是黄仁勋数据成为基础设施;深度学习赢过主流视觉
首尔的五番棋2016哈萨比斯、西尔弗、李世石……强化学习与自我对弈被全世界看见
八个作者的标题2017Vaswani 等八人序列模型的默认骨架换成 Transformer
实验室的门打开2022OpenAI 实验室外的亿级用户大模型从论文走进日常
斯德哥尔摩的两张奖2024霍普菲尔德、辛顿;贝克、哈萨比斯、江珀寒冷年代的线被写进诺贝尔史

时刻一:达特茅斯的夏天

1956 年夏天,约翰·麦卡锡把一群人叫到新罕布什尔的达特茅斯。前一年的提案里,他们给这件事起名叫 artificial intelligence。马文·明斯基、克劳德·香农、纳撒尼尔·罗切斯特在场。名字先于能力。房间里的人相信:学习、语言、抽象,原则上都可以被机器做出来。

那不是一次「发明神经网络」的会议。它的力量在于命名与召集:此后三十年的经费、冬天、争论,都绕着这个名字转。

技术章入口: 语言模型定义 · 历史演进


时刻二:反向传播回到桌上

1986 年,戴维·鲁梅尔哈特、杰弗里·辛顿、罗纳德·威廉姆斯把误差一层一层往回传的方法,重新写成一批人会用的工具。更早的人已经碰过这个想法。1986 年的意义是:它再次站上桌面。

神经网络在感知机被批评之后进过冬天。这一刻没有立刻带来今天的大模型,但它让「深层」重新合法。杨立昆的卷积、霍赫赖特与施米德胡伯的 LSTM,都在这条解冻的河岸上往前走。

技术章入口: 语言模型历史 · 训练方法 · 群像里的冬天里没有散场的人


时刻三:ImageNet 的赛场与多伦多的卧室

故事常被说成「两张游戏卡赢了比赛」。更完整的说法是:李飞飞先把赛场搭起来,卧室里的人再在赛场上赢。

2007 年前后,李飞飞在普林斯顿判断:视觉缺的不是又一个手工特征,而是一张大到能把算法比出高下的标注图。ImageNet 按 WordNet 层级组织类别,靠众包标出逾千万图像,2009 年公开,ILSVRC 成为赛场。头几年传统计算机视觉仍赢。没有这张图,后面的转折没有观众席,也没有裁判。

2012 年,亚历克斯·克里热夫斯基在父母家的卧室里,用两张 NVIDIA GTX 580 训练了后来叫做 AlexNet 的网络。伊利亚·苏茨克维认定这件事该做,辛顿是导师。他们在 ImageNet 上把传统方法甩开一大截。同一年,黄仁勋的公司已经把 CUDA 押了六年。游戏卡第一次被全世界的视觉研究者当成科学仪器。

辛顿后来说:Ilya 觉得该做,Alex 做成了,奖给了我。图谱里还要补上第四句:赛场是李飞飞搭的。

李飞飞后来任斯坦福 SAIL 主任、HAI 共同创办人,并创办 World Labs,把「空间智能 / 世界模型」推成下一道缝。人名与贡献表见AI 人物图谱 · 李飞飞专节。

技术章入口: Scaling · 硬件与黄仁勋 · 世界模型 · 科学家


时刻四:首尔的五番棋

2016 年 3 月,首尔。DeepMind 的 AlphaGo 对李世石,五番棋,4 比 1。哈萨比斯是实验室的召集人,大卫·西尔弗领衔算法,黄士杰把程序的落子摆到实棋上。第二局的第 37 手像落错了地方;第四局李世石下出「神之一手」。

两亿人次看过转播。强化学习、自我对弈、搜索,从论文里的词变成棋盘上的一手。游戏仍是显微镜;显微镜后面是科学。

技术章入口: 强化学习 · 后训练 · 哈萨比斯与 DeepMind


时刻五:八个作者的标题

2017 年,谷歌的八个作者发表《Attention Is All You Need》:Vaswani、Shazeer、Parmar、Uszkoreit、Jones、Gomez、Kaiser、Polosukhin。标题像一句口号,作者列表本身就是群像。

循环网络一步一步走时间;注意力让训练更可并行。后面的 BERT、GPT,以及今天所有「大模型」默认骨架,都站在这篇论文上。同年,NVIDIA 的 Volta 带上 Tensor Core——结构与芯片再次同岁。

技术章入口: Transformer · 自注意力 · 结构拆解


时刻六:实验室的门打开

2022 年 11 月前后,ChatGPT 把对话界面推到实验室外面。论文里的 in-context learning、指令跟随,变成上亿人会用的产品动作。苏茨克维等人参与的那条从 AlexNet 到大规模预训练的线,在这一刻碰到了非研究者。

涌现、对齐、应用开发,从此不再只是研讨会词汇。你笔记里的第 4 到第 7 章,很多问题是从这个月之后才长出「必须写下来」的理由。

技术章入口: 涌现能力 · 应用开发 · 后训练


时刻七:斯德哥尔摩的两张奖

2024 年,诺贝尔物理学奖给了约翰·霍普菲尔德与杰弗里·辛顿,表彰人工神经网络的基础工作。化学奖的一半给了戴维·贝克,另一半由德米斯·哈萨比斯与约翰·江珀共享,表彰蛋白质结构预测。

冬天里留在桌边的人,和把游戏公司做成科学实验室的人,被写进同一年的授奖词。奖不是故事的结尾——它把「这件事曾经不可置信」写进了公共记忆。

技术章入口: 科学家群像 · DeepMind 与 AlphaFold · 延展:多模态与世界模型


时刻之后:仍在闪耀的缝

茨威格的书停在已经完成的瞬间。我们的史诗还没有停。下面这些缝,人物已到场,结局未写完:

缝在场的人与方向笔记入口
多模态与生成视觉编码器接上语言模型;扩散与 DiT 做图、视频、3D延展
世界模型Ha、Schmidhuber;杨立昆的 JEPA;Genie / Cosmos世界模型
具身智能RT-2、π0、GR00T……泛化控制仍未解决具身智能
垂直现场例如车损三维重构:CrashSplat、CarDD、定损产业车损三维重构

怎么用这一页串章节

  1. 先人后式: 从上表挑一个时刻 → 读人物页 → 再进技术章。
  2. 先式后人: 在公式里卡住 → 回到本页找「是谁在什么场合需要这个式子」。
  3. 自己补第八个时刻: 新论文、新发布若真的改变了默认假设,写成新的一节,并链到技术章。不要只改年份表。