语言模型历史演进

先讲故事

「历史演进」四个字,若只排 ELMo、BERT、GPT 的名字,会读成说明书。这一章真正要复原的是:在每一个节点上,人把什么当成了默认,以及默认被改掉时,房间里站着谁。

从「能算」到「能说」

阿兰·图灵把可计算写成纸带与规则,又把「机器能不能思考」换成一个更可操作的问法。克劳德·香农让信息可以计量。这些句子在科学家群像里。语言建模后来默认的统计与序列,都站在这份语法上。

达特茅斯之后,符号派与连接派争了很久。感知机的热与冷、冬天的经费撤退,决定了「神经网络」有几十年不当主角。你在本章读到的自回归、n-gram、神经语言模型,是这条长河后来才汇进主流的几段。

表示:词怎样变成能算的东西

在深度学习重新合法之前,词的表示走过 one-hot、共现矩阵、再到分布式向量。2013 年前后,Tomas Mikolov 等人的 Word2Vec 让「近义的词在空间里靠近」变成工程师会用的工具;FastText 把子词也加进去。它们不是主线明星传记里的一章,却是本章「文本表示」节的主角——见群像突破。

编码与解码:翻译房间里的注意力

序列到序列曾被 RNN 绑在时间步上。2014 年,苏茨克维、Vinyals、Le 的 Seq2Seq 把编码—解码写成可训练的管线;Bahdanau、Cho、本吉奥让解码器在源句上「看」——注意力进了 NLP 的日常。没有这一步,2017 年「Attention Is All You Need」不会听起来像一句自然的下一句。

赛场、卧室、然后是语言

李飞飞的 ImageNet 与 2012 年多伦多卧室,表面是视觉的故事。它改掉的是整个领域的信心:数据够大、算力够用、网络够深时,端到端可以赢过精雕细琢的特征工程。语言侧的「大力出奇迹」,很大程度借了这场胜利的胆气。时刻三

八个作者与两条岔路

2017 年谷歌八人组换掉默认骨架。时刻五 之后,路很快分叉:

  • 编码器一侧,Jacob Devlin 等人的 BERT(2018)用双向掩码把「理解」推上榜单;
  • 解码器一侧,Alec Radford 等人的 GPT,把「下一个 token」一路做到 GPT-2;Tom Brown 等人的 GPT-3(2020)把 few-shot 写进标题。

本章左侧 1.1.7、1.1.8 就是这两条岔路的细部。人名钉在群像突破 · 第 1 章。

读完故事再进本章

从定义、自回归、表示,走到 Transformer 与 LLM。每一步都对应上面某一间屋子。式子与结构在子节;人与时刻在史诗。

概念线

这一章走概念线:定义、自回归、表示、Transformer、编码器与解码器怎样长成今天的 LLM。两章对照着读。