人工智能面试题更新 2026-08-05

请解释 GRPO 与 PPO 的主要区别,并说明各自的损失函数设计。

滴滴人工智能问题拆解技术原理

考察说明

考察对强化学习微调算法(GRPO 与 PPO)的机制理解和损失函数推导能力

回答思路

  1. 准确阐述 GRPO 与 PPO 在策略更新方式上的核心差异(如价值网络、优势估计、组内采样)
  2. 正确写出或说明 GRPO 的损失函数形式,包括组内相对优势与 KL 散度约束
  3. 能结合数学公式解释 GRPO 如何降低方差、简化训练流程
  4. 能指出两者适用场景与权衡(如计算成本、稳定性)