人工智能面试题更新 2026-08-05

请描述RLHF(基于人类反馈的强化学习)的核心机制,包括其关键步骤和训练流程。

人工智能技术原理

考察说明

考察对RLHF训练范式的理解,重点关注监督微调、奖励建模和强化学习优化等环节及其相互作用。

回答思路

  1. 【回答框架 1】RLHF包括三个关键阶段:监督微调(SFT)、奖励模型训练和基于强化学习的优化。在SFT阶段,使用人类标注的高质量问答数据对预训练模型进行微调,使模型具备基本的指令遵循能力,这是后续步骤的基础。
  2. 【回答框架 2】奖励模型训练阶段,利用人类对多个模型输出的比较(如排名)来训练一个奖励模型,该模型为给定输入和输出打分,分数反映人类偏好。具体而言,对于同一提示生成的两个回答,根据人类偏好标记,使用排序损失(如pairwise ranking loss)优化奖励模型。
  3. 【回答框架 3】强化学习优化阶段,使用PPO(近端策略优化)等算法进一步优化初始语言模型。在此过程中,模型生成输出,奖励模型给出分数作为奖励信号,同时加入与参考模型的KL散度惩罚项,以避免模型偏离原始分布过远。优化过程迭代进行,直至模型表现稳定。
  4. 【回答框架 4】各阶段的目的不同:SFT使模型学会基本对话格式,奖励模型量化人类偏好,RL阶段用奖励信号调整策略,使模型产生更符合偏好的回答。数据质量和偏差控制、训练稳定性是需要关注的难点。
  5. 【关键点 1】RLHF三阶段:SFT、奖励建模、RL优化。
  6. 【关键点 2】奖励模型基于人类排序数据训练,输出偏好分数。
  7. 【关键点 3】PPO优化带KL惩罚,防止模型过度偏离。
  8. 【关键点 4】KL散度惩罚平衡探索与稳定。
  9. 【易错点 1】不能把奖励模型分数当作绝对真实值,它只是人类偏好的代理。
  10. 【易错点 2】PPO训练对超参数敏感,容易出现模型崩溃或输出退化。
  11. 【易错点 3】奖励模型若存在偏差,会传导给最终的模型策略。