大模型概述与基础原理
先讲故事
这一章要拆的概念——语言模型、Transformer、Scaling、涌现——不是从天上掉下来的定义。它们是一连串房间里的人,在具体年份里把默认假设改掉之后,才变成今天的常识。把故事讲细一点,再进左侧的式子。
名字先到的那个夏天
1956 年,新罕布什尔的达特茅斯。约翰·麦卡锡把一群人叫到一起,提案里已经写好 artificial intelligence。马文·明斯基、克劳德·香农在场。他们相信:学习、语言、抽象,原则上都可以被机器做出来。那不是一次「发明了神经网络」的会议。它的力量在于命名与召集——此后三十年的经费、冬天、学报上的争论,都绕着这个名字转。能力还没跟上,名字已经把人聚进同一间屋子。群星闪耀时刻 · 时刻一
感知机曾经让报纸兴奋;明斯基与帕珀特把单层网络的限度写清楚之后,经费离开了。冬天赶的是钱和注意力,不是所有人。
冬天里没散场的桌边
1986 年,戴维·鲁梅尔哈特、杰弗里·辛顿、罗纳德·威廉姆斯把「误差一层一层往回传」重新写成一批人会用的工具。更早的人碰过这个想法;这一年的意义是它再次站上桌面。杨立昆在贝尔实验室把卷积用到支票数字上——网络开始知道图像有局部结构。塞普·霍赫赖特与于尔根·施米德胡伯的 LSTM,让序列不那么容易立刻忘掉过去。约书亚·本吉奥沿着语言和概率把网往深处推。他们后来被称为深度学习三巨头,但在那几年,相信「深层」的人仍是少数。时刻二 · 科学家
赛场与卧室
2007 年前后,李飞飞在普林斯顿做了一个很硬的判断:视觉缺的不是又一个手工特征,而是一张大到能把算法比出高下的标注图。ImageNet 靠众包标出逾千万图像,2009 年公开,竞赛成为赛场。头几年传统方法仍赢。
2012 年,真正说服领域的实验,发生在亚历克斯·克里热夫斯基父母家的卧室里:两张 NVIDIA GTX 580,五到六天,AlexNet 在 ImageNet 上把对手甩开。伊利亚·苏茨克维认定该做,辛顿是导师。卡的背后,是黄仁勋的公司已经把 CUDA 押了六年——游戏卡第一次被全世界的视觉研究者当成科学仪器。辛顿后来说:Ilya 觉得该做,Alex 做成了,奖给了我。图谱里还要补一句:赛场是李飞飞搭的。时刻三 · 李飞飞专节
八个作者换掉骨架
2017 年,谷歌的八个作者发表《Attention Is All You Need》。标题像口号,作者列表本身就是群像:Vaswani、Shazeer、Parmar……循环网络一步一步走时间;注意力让训练更可并行。同年,NVIDIA 的 Volta 带上 Tensor Core。结构与芯片再次同岁。后面的 BERT、GPT,以及你今天说的「大模型」,默认骨架都站在这篇论文上。时刻五
门打开之后
2022 年底前后,对话界面把实验室推到外面。论文里的 in-context learning、指令跟随,变成上亿人会用的产品动作。涌现、对齐、应用开发,从此不再只是研讨会词汇。你笔记里第 4 到第 7 章的许多问题,是从这个月之后才长出「必须写下来」的理由。时刻六
2024 年,霍普菲尔德与辛顿、哈萨比斯与江珀先后走上斯德哥尔摩的授奖台——冬天里留在桌边的人,被写进公共记忆。时刻七
读完故事再进本章
- 查名人房间:AI 人物图谱 · 技术史诗
- 查本章方法背后的作者(Word2Vec、BERT、Scaling、CoT…):群像突破 · 第 1 章
再拆概念
故事之后,这一章走概念线:历史怎样长到 LLM,结构为什么是注意力,规模与涌现怎样被观察。左侧 1.1 起往下读。式子卡住时,回到上面的场景——人还在场。