人工智能面试题更新 2026-08-05

请详细解释 RLHF(基于人类反馈的强化学习)的原理,重点介绍 PPO 算法的工作原理。

百度人工智能专业服务问题拆解技术原理

考察说明

考察对 RLHF 框架及 PPO 算法原理的深入理解

回答思路

  1. 清晰说明 RLHF 的三阶段流程(SFT、奖励模型训练、PPO 微调)
  2. 准确解释 PPO 的损失函数、重要性采样和裁剪机制
  3. 能说明 PPO 相比普通策略梯度的优势及在 RLHF 中的具体作用