互联网/IT行业面试题更新 2026-08-05

请解释 DPO 和 PPO 这两种强化学习微调方法的核心区别并说明各自的适用场景。

小红书快手人工智能互联网/IT专业服务持续改进技术原理方案权衡

考察说明

考察对强化学习微调方法(PPO 与 DPO)原理和适用场景的理解

回答思路

  1. 能准确说明 PPO 是基于策略梯度的在线强化学习算法,需要奖励模型和采样交互
  2. 能准确说明 DPO 是直接将偏好数据转化为隐式奖励来优化策略,无需单独训练奖励模型
  3. 能对比两者在训练稳定性、计算成本、数据需求和实现复杂度上的差异
  4. 能结合具体场景说明何种情况下选择 PPO 或 DPO