大模型后训练

预计学习时间:45分钟

先讲故事

预训练解决的是:在文本的统计里,长出一种会续写的能力。后训练要回答另一件事——这种能力怎样变得听话、有用、敢交到陌生人手里。故事要从棋盘讲起,再讲到对话框。

首尔:反馈怎样变成可以看见的一手

2016 年 3 月,首尔。DeepMind 的 AlphaGo 对李世石,五番棋,4 比 1。哈萨比斯是实验室的召集人;大卫·西尔弗领衔算法;黄士杰把程序的落子摆到实棋上。第二局的第 37 手像落错了地方——职业棋手愣住,后来它成了「机器也能走出稀有好手」的象征。第四局李世石下出「神之一手」,人赢了一盘。两亿人次看过转播。

强化学习、自我对弈、搜索,从此不再只是论文摘要里的词。哈萨比斯说游戏是显微镜:规则清楚、分数清楚,进步看得见。显微镜后面,才是更一般的「用反馈改策略」。时刻四 · DeepMind

萨顿与巴托的教科书传统、Schulman 的 TRPO / PPO,是这间屋子更早的地板。群像名字在群像突破 · 第 3 章。

从棋谱到对话:RLHF 走进聊天框

棋有输赢。对话没有单一的「赢」。Paul Christiano 等人把「人类偏好」写成可学的信号;OpenAI 的 InstructGPT 一系里,Long Ouyang 等人把标注、奖励模型、PPO 串成可复现的管线——模型先学「该听怎样的指令」,再学「哪种回答更被人选」。这就是后来口头禅里的 RLHF。

再往后,全套 RL 环太重,Rafael Rafailov 等人的 DPO 用偏好对直接改策略,绕开显式奖励模型;DeepSeek 等团队的 GRPO 继续变体。方法名在变,问题没变:预训练的续写本能,怎样对齐到人要用的行为。

门打开:后训练从研究词变成产品词

2022 年底对话产品冲出实验室之后,「有没有做过对齐」变成用户能不能忍受的分界线。安全、拒绝、口吻、工具使用——都挂在后训练这一段。没有这段故事,你会误以为预训练检查点可以直接当助手卖。时刻六

测试时再花算力

还有一刀发生在推理时刻:Chain-of-Thought(Jason Wei 等)、树搜索与更长的思考链,让模型在读题之后多花计算。训练堆卡之外,测试也可以堆步骤。本章 3.4 读的就是这把刀。

Test-time Scaling 则是另一刀:训练时堆算力之外,推理时也可以多想几步。微调的动手部分收在本章 3.5 微调实战(数据、框架、硬件、训练方法)——理论在 3.2,实操在 3.5。

读完故事再进本章

下面按继续预训练、SFT / PEFT、偏好对齐、Test-time,再到 3.5 实战。LoRA(Edward Hu 等)、QLoRA(Dettmers)与实战节是同一条河的两岸。

后训练(Post-training)是指在预训练大模型完成后,为了进一步提升模型性能和适应性而进行的一系列训练步骤。

后训练的重要性

大模型后训练是连接预训练与实际应用的关键环节,通过后训练可以使模型更好地适应特定任务和场景,提高模型的可用性和实用价值。

  • 性能提升:通过后训练可以显著提高模型在特定任务上的表现
  • 知识更新:补充模型预训练后可能缺失的最新知识
  • 安全对齐:确保模型输出符合人类价值观和伦理要求

主要后训练阶段

阶段目标主要方法
继续预训练补充领域知识领域数据继续预训练
监督微调提升特定任务能力SFT、LoRA、QLoRA
偏好对齐使模型输出符合人类偏好RLHF、DPO、PPO
红队测试发现并修复安全漏洞对抗测试、毒性过滤

后训练的关键挑战

后训练过程中面临的主要挑战包括:

  1. 如何避免模型在后训练过程中遗忘通用能力
  2. 如何平衡模型的创造性与安全性
  3. 如何高效利用有限的计算资源进行后训练

后训练过程中的数据质量对最终模型表现至关重要,低质量数据可能导致模型能力下降。

大模型后训练流程图

在接下来的章节中,我们将详细介绍后训练的各个方面,包括后训练简介、具体方法、训练目标以及面临的挑战。

Keep Hungry · 大模型笔记