汽车行业面试题更新 2026-08-05

请比较 DPO、PPO 和 GRPO 三种强化学习/偏好优化方法在训练大语言模型时的适用场景与差异。

美团蔚来人工智能互联网/IT汽车技术原理方案权衡

考察说明

考察对主流偏好优化方法原理与适用场景的理解

回答思路

  1. 准确说明 PPO 是带评论家的策略梯度方法及其在 RLHF 中的应用
  2. 准确说明 DPO 直接基于偏好数据优化策略、无需显式奖励模型
  3. 准确说明 GRPO 在 PPO 基础上去除批评家、使用组内相对优势
  4. 能结合训练稳定性、计算成本、样本效率说明三者取舍