HF(基于人类反馈的强化学习)在 GPT 系列模型的对齐中起到了关键性的桥梁作用,它解决了传统语言模型“有能力但不可控”的核心矛盾,使模型从“能生成文本”进化到“能生成符合人类期望的文本”。
一、RLHF 在 GPT 系列对齐中的作用
在 GPT-3 等早期大模型中,模型虽然能力强大,但存在严重的未对齐(misalignment)问题,具体表现为:
- 不遵循指令:答非所问,不按用户要求执行。
- 胡编乱造:生成看似合理但实际虚假的内容(幻觉)。
- 缺乏可解释性:人类难以理解模型为何给出某个回答。
- 生成有害内容:输出带有偏见、歧视或危险的信息。
RLHF 的作用正是将人类的偏好、价值观和判断标准注入模型训练过程,让模型学会:
- 遵循指令:更准确地理解并执行用户的明确要求。
- 提高有用性:生成更相关、更连贯、更符合上下文的回答。
- 增强诚实性:减少幻觉,对不确定的内容能坦诚表示不知道。
- 确保无害性:主动规避生成有害、偏见或不当的内容。
简单来说,RLHF 是让 GPT 系列从“强大的语言模型”转变为“安全、有用、可信赖的 AI 助手”的临门一脚。
二、RLHF 的主要阶段
RLHF 通常包含三个核心阶段,这也是 InstructGPT / ChatGPT / GPT-4 训练的关键流程:
阶段一:监督微调(SFT,Supervised Fine-Tuning)
- 目标:让模型初步学会遵循指令和对话的格式。
- 做法:
- 从数据集中随机抽取用户问题。
- 由人类标注员写出高质量的、符合人类偏好的标准答案。
- 用这些人工标注的“问题-答案”对,对预训练好的 GPT 模型进行有监督微调。
- 产出:得到一个初步具备指令跟随能力的SFT 模型。但此时模型仍可能不完全符合人类偏好,且存在生成有害内容的风险。
阶段二:训练奖励模型(RM,Reward Model)
- 目标:训练一个能够自动评估回答质量的“裁判”模型。
- 做法:
- 使用阶段一的 SFT 模型,对同一个问题生成多个不同的候选回答。
- 由人类标注员对这些回答进行排序(例如 A > B > C),而非直接打分。
- 利用这些排序数据,训练一个奖励模型。该模型输入一个回答,输出一个标量分数(奖励值),分数越高代表越符合人类偏好。
- 产出:得到一个可以替代人类进行大规模、低成本评估的RM 模型。
阶段三:强化学习微调(PPO 优化)
- 目标:利用奖励模型作为反馈信号,通过强化学习进一步优化 SFT 模型。
- 做法:
- 使用近端策略优化(PPO,Proximal Policy Optimization)算法。
- 当前策略模型(即正在被训练的模型)生成回答。
- 阶段二训练好的奖励模型为该回答打分。
- PPO 算法根据这个分数,调整模型的参数,使其倾向于生成能获得更高奖励的回答。
- 这个过程迭代进行,模型不断学习如何生成更符合人类偏好的内容。
- 产出:最终得到一个对齐后的策略模型,也就是我们实际使用的 ChatGPT / GPT-4 等模型。
常见坑点与补充
- 奖励模型的局限性:奖励模型本身也是由人类标注数据训练的,它可能会被“钻空子”,即模型学会生成一些看似高分但实际无意义或取巧的内容(奖励黑客)。因此,RLHF 的迭代过程需要持续监控和优化。
- 数据质量是关键:RLHF 的效果高度依赖于人类标注员的质量和一致性。标注员之间的主观差异、标注疲劳等都会影响最终模型的对齐效果。
- 你可能还需要了解:除了 RLHF,目前还有DPO(Direct Preference Optimization,直接偏好优化)等更简洁的对齐方法,它们不需要显式训练奖励模型,而是直接从偏好数据中优化策略,在某些场景下效率更高。