大模型后训练
预计学习时间:45分钟
先讲故事
预训练解决的是:在文本的统计里,长出一种会续写的能力。后训练要回答另一件事——这种能力怎样变得听话、有用、敢交到陌生人手里。故事要从棋盘讲起,再讲到对话框。
首尔:反馈怎样变成可以看见的一手
2016 年 3 月,首尔。DeepMind 的 AlphaGo 对李世石,五番棋,4 比 1。哈萨比斯是实验室的召集人;大卫·西尔弗领衔算法;黄士杰把程序的落子摆到实棋上。第二局的第 37 手像落错了地方——职业棋手愣住,后来它成了「机器也能走出稀有好手」的象征。第四局李世石下出「神之一手」,人赢了一盘。两亿人次看过转播。
强化学习、自我对弈、搜索,从此不再只是论文摘要里的词。哈萨比斯说游戏是显微镜:规则清楚、分数清楚,进步看得见。显微镜后面,才是更一般的「用反馈改策略」。时刻四 · DeepMind
萨顿与巴托的教科书传统、Schulman 的 TRPO / PPO,是这间屋子更早的地板。群像名字在群像突破 · 第 3 章。
从棋谱到对话:RLHF 走进聊天框
棋有输赢。对话没有单一的「赢」。Paul Christiano 等人把「人类偏好」写成可学的信号;OpenAI 的 InstructGPT 一系里,Long Ouyang 等人把标注、奖励模型、PPO 串成可复现的管线——模型先学「该听怎样的指令」,再学「哪种回答更被人选」。这就是后来口头禅里的 RLHF。
再往后,全套 RL 环太重,Rafael Rafailov 等人的 DPO 用偏好对直接改策略,绕开显式奖励模型;DeepSeek 等团队的 GRPO 继续变体。方法名在变,问题没变:预训练的续写本能,怎样对齐到人要用的行为。
门打开:后训练从研究词变成产品词
2022 年底对话产品冲出实验室之后,「有没有做过对齐」变成用户能不能忍受的分界线。安全、拒绝、口吻、工具使用——都挂在后训练这一段。没有这段故事,你会误以为预训练检查点可以直接当助手卖。时刻六
测试时再花算力
还有一刀发生在推理时刻:Chain-of-Thought(Jason Wei 等)、树搜索与更长的思考链,让模型在读题之后多花计算。训练堆卡之外,测试也可以堆步骤。本章 3.4 读的就是这把刀。
Test-time Scaling 则是另一刀:训练时堆算力之外,推理时也可以多想几步。微调的动手部分收在本章 3.5 微调实战(数据、框架、硬件、训练方法)——理论在 3.2,实操在 3.5。
读完故事再进本章
下面按继续预训练、SFT / PEFT、偏好对齐、Test-time,再到 3.5 实战。LoRA(Edward Hu 等)、QLoRA(Dettmers)与实战节是同一条河的两岸。
后训练(Post-training)是指在预训练大模型完成后,为了进一步提升模型性能和适应性而进行的一系列训练步骤。
后训练的重要性
大模型后训练是连接预训练与实际应用的关键环节,通过后训练可以使模型更好地适应特定任务和场景,提高模型的可用性和实用价值。
- 性能提升:通过后训练可以显著提高模型在特定任务上的表现
- 知识更新:补充模型预训练后可能缺失的最新知识
- 安全对齐:确保模型输出符合人类价值观和伦理要求
主要后训练阶段
| 阶段 | 目标 | 主要方法 |
|---|---|---|
| 继续预训练 | 补充领域知识 | 领域数据继续预训练 |
| 监督微调 | 提升特定任务能力 | SFT、LoRA、QLoRA |
| 偏好对齐 | 使模型输出符合人类偏好 | RLHF、DPO、PPO |
| 红队测试 | 发现并修复安全漏洞 | 对抗测试、毒性过滤 |
后训练的关键挑战
后训练过程中面临的主要挑战包括:
- 如何避免模型在后训练过程中遗忘通用能力
- 如何平衡模型的创造性与安全性
- 如何高效利用有限的计算资源进行后训练
后训练过程中的数据质量对最终模型表现至关重要,低质量数据可能导致模型能力下降。
