把我们带到这里的人
先把读法说死:这里记的是一连串房间,不是一条「天才传承」。奥本海默的位置是召集人。大模型这边也一样,召集人会换,房间会增加。
若你想按「决定性瞬间」而不是按屋子读,先打开群星闪耀时刻;本页是同一批人的长群像。
计算与信息
现代这套机器的语法,在二战前后的几个房间里已经写出来了。
阿兰·图灵在 1936 年把「什么是可计算」写成一条纸带和一组规则。1950 年他又把问题换了一个问法:如果一台机器在对话里让人分不出来,我们要不要认真对待它。克劳德·香农在 1948 年把信息写成可以计量的东西,噪声、编码、信道从此有了账。约翰·冯·诺依曼把程序和数据放进同一块存储器,后来的计算机大体还是这个形状。
这三个人并不在同一个项目里上班。把他们放在一节,是因为后面的神经网络、语言模型、芯片,都默认这些句子已经成立。
固体里的开关
1947 年 12 月,贝尔实验室的约翰·巴丁、沃尔特·布拉顿和威廉·肖克利做出点接触晶体管。电子管那间又热又脆的屋子,开始被一小块固体替换。
1958 年杰克·基尔比在德州仪器做出集成电路,1959 年罗伯特·诺伊斯在仙童做出平面工艺,电路可以真的被制造、被复制。戈登·摩尔在 1965 年把「同样的钱能买到的元件数会按规律变多」写成观察。1968 年诺伊斯、摩尔和安迪·格鲁夫成立英特尔,1971 年 4004 把一台计算机的处理器放进一块芯片。
这间屋子的后半段在硬件脉络与黄仁勋。这里先记住:算法页里的「算力」,物理上是从这间屋子长出来的。
达特茅斯的夏天
1956 年夏天,约翰·麦卡锡、马文·明斯基、克劳德·香农、纳撒尼尔·罗切斯特等人在达特茅斯开会。前一年的提案里,他们把这件事叫做 artificial intelligence。名字先于能力。房间里的人相信,学习、语言、抽象,原则上都可以被机器做出来。
1950 年代末,弗兰克·罗森布拉特的感知机让报纸相信机器已经能认识图案。1969 年明斯基和西摩·帕珀特的《感知机》把单层网络的限度写清楚:有些简单的划分,它学不会。批评是对的。经费和口味随后离开了神经网络,这件事后来被叫做冬天。
冬天里断掉的是经费和注意力,不是所有的线。
冬天里没有散场的人
1986 年,戴维·鲁梅尔哈特、杰弗里·辛顿和罗纳德·威廉姆斯把反向传播写成一层一层可以训练的方法。更早的人已经碰过这个想法,1986 年的意义是它重新变成一批人会用的工具。
杨立昆在贝尔实验室把卷积用到支票和邮政编码上。网络开始知道图像有局部结构,权重要共享。1997 年,塞普·霍赫赖特和于尔根·施米德胡伯发表 LSTM,序列终于有了一种不太容易马上忘掉过去的写法。约书亚·本吉奥沿着语言和概率把网往深处推。辛顿留在多伦多,也在伦敦的 Gatsby 计算神经科学单元留下一条线,后来和哈萨比斯的房间会接到一起。
2006 年前后,「深度学习」这个说法回到论文标题里。相信它的人仍然是少数。
数据是另一群人的工作:李飞飞与 ImageNet
算法房间喜欢讲模型。2012 年之前,视觉房间缺的是可以公平比试的大规模标注数据。
李飞飞(Fei-Fei Li)把这件事做成了基础设施。她 1976 年生于北京,普林斯顿物理本科,加州理工博士,经伊利诺伊、普林斯顿任教后于 2009 年加入斯坦福,后任斯坦福人工智能实验室(SAIL)主任,并共同创办斯坦福 Human-Centered AI Institute(HAI)。2017–2018 年曾任 Google Cloud AI/ML 首席科学家。2020 年代创办 World Labs,推动空间智能与世界模型——和延展里的世界模型是同一道缝。
2007 年前后在普林斯顿,她的判断很具体:缺的不是又一个 SIFT 式手工特征,而是一张大到能把方法比出高下的图,以及图上的词。ImageNet 用 WordNet 的层级组织类别,借助众包(含 Amazon Mechanical Turk)完成海量标注;邓嘉等是核心合作者。2009 年数据集公开后,ImageNet 大规模视觉识别挑战赛(ILSVRC)成为赛场。头几年赢的仍是传统计算机视觉。神经网络还没有证明自己配得上这张图。
没有李飞飞这间「数据屋子」,下一节卧室里的两张卡,赢的是另一场没有观众的比赛。更全的人名表见AI 人物图谱。
2012:多伦多的卧室
说服整个领域的那次实验,发生在亚历克斯·克里热夫斯基父母家的卧室里。两张 NVIDIA GTX 580,3GB 显存,训练五到六天。论文作者是克里热夫斯基、伊利亚·苏茨克维和辛顿。苏茨克维认定这件事该做,克里热夫斯基把 CUDA 代码榨到能跑,辛顿是导师。
ImageNet 竞赛上,他们的 top-5 错误率约 15.3%,下一名传统方法大约在 26%。2012 年 10 月,克里热夫斯基在佛罗伦萨报告这篇工作。现场不少计算机视觉的老人不信。杨立昆在场,认定这是转折。
辛顿后来对计算机历史博物馆说了一句很适合写进群像的话:「Ilya thought we should do it, Alex made it work, and I got the Nobel Prize.」伊利亚认定要做,亚历克斯把它做成,奖最后给了导师。
奖是 2024 年才来的。物理学奖颁给约翰·霍普菲尔德和辛顿,理由是人工神经网络的基础工作。同一年的化学奖则把蛋白质这间屋子也算了进去,写在 DeepMind 那一页。
2012 年同时还有别的房间。谷歌的杰夫·迪恩、吴恩达等人在大规模数据和集群上训练视觉网络。丹·奇雷尚在施米德胡伯的实验室里,更早用 GPU 赢过较小的图像比赛。转折不是一声枪响,是好几组人同时摸到了同一件东西:数据够大,GPU 够用,网络够深。
八个作者的注意力
2017 年,谷歌的八个作者发表《Attention Is All You Need》:Vaswani、Shazeer、Parmar、Uszkoreit、Jones、Gomez、Kaiser、Polosukhin。标题很响,作者列表本身就是群像。
这篇论文把序列模型从「必须一步一步沿着时间走」里松开,训练可以更平行,上下文可以更长。后面的 GPT、BERT,以及今天的大模型,都站在这个结构上。公式和模块拆解在语言模型历史里,这一页只记人:一个实验室里的一组人,把后面十年的默认架构换掉了。
实验室变成外面的世界
2010 年代后半,房间的名字变成了实验室:DeepMind、Google Brain、FAIR、OpenAI。杨立昆在 FAIR,辛顿后来去了谷歌,苏茨克维成为 OpenAI 的联合创始人之一。人在机构之间走动,想法跟着走。
2022 年底 ChatGPT 把实验室的门打开。外面的人开始用,也开始害怕,也开始拿它干活。技术章节从这里接上。群像没有结束,只是名字多到一页写不下:开源权重组、芯片组、产品组、安全组,每组都有自己的召集人。
读的时候抓住的三件事
- 名字往往早于能力。达特茅斯先有了 artificial intelligence,ImageNet 先有了赛场,CUDA 先有了可编程的卡,然后能力才追上来。
- 冬天会赶走经费,赶不走所有人。留下来的人后来互相引证。
- 2012 年那两张游戏卡是接缝。算法房间和芯片房间在这里第一次被外面的人同时看见。
还想补
- 反向传播更早的线索:韦尔博斯、林奈因马,避免把 1986 年写成「发明」。
- 本吉奥、杨立昆、辛顿 2018 年图灵奖演讲里,他们自己怎么讲这三十年。
- 给李飞飞开独立长传记页(ImageNet 决策过程、HAI、World Labs),从人物图谱链出。
- 中国与开源侧按机构加厚:见图谱第 13 节骨架。