请解释 GRPO 与 PPO 的主要区别,并说明各自的损失函数设计。
考察说明
考察对强化学习微调算法(GRPO 与 PPO)的机制理解和损失函数推导能力
回答思路
- 准确阐述 GRPO 与 PPO 在策略更新方式上的核心差异(如价值网络、优势估计、组内采样)
- 正确写出或说明 GRPO 的损失函数形式,包括组内相对优势与 KL 散度约束
- 能结合数学公式解释 GRPO 如何降低方差、简化训练流程
- 能指出两者适用场景与权衡(如计算成本、稳定性)
考察对强化学习微调算法(GRPO 与 PPO)的机制理解和损失函数推导能力