DPO
直接偏好优化(Direct Preference Optimization)用偏好对直接改策略,绕开显式奖励模型与复杂 RL 环。
群像: Rafael Rafailov、Archit Sharma、Eric Mitchell、Stefano Ermon、Christopher Manning、Chelsea Finn(2023)。主线里对齐故事从 InstructGPT / RLHF 讲起;DPO 是随后被广泛采用的简化突破。——群像突破 · 第 3 章 · 后训练
细节与公式按左侧后训练、强化学习子节继续补。左侧若已有更长草稿,以长稿为准;本页先把人名钉住。