Reinforcement learning

后训练里,强化学习负责:在给定偏好或奖励信号下,改策略。本页起拆定义、PPO / DPO / GRPO、奖励模型与挑战——这是概念线。

人物入口: 强化学习被全世界看见,很大程度是 2016 年首尔五番棋——哈萨比斯、西尔弗、李世石。群星闪耀时刻 · 时刻四 · 哈萨比斯与 DeepMind。游戏是显微镜;显微镜后面的科学与后训练方法,从左侧 3.3 往下读。