GRPO 比 PPO(近端策略优化)强在哪?
考察说明
考察强化学习算法对比与原理理解,重点是 GRPO 相对 PPO 的优势和适用场景
回答思路
- 准确说出 GRPO 的核心方法:组内相对优势估计,去掉 critic 网络
- 说明 GRPO 通过多次采样计算优势,降低方差且减少计算开销
- 指出 PPO 依赖 critic 网络带来的训练不稳定和资源消耗问题
- 结合大模型 RL(如 RLHF)场景说明 GRPO 的适配性,样本效率与稳定性
- 对比两者在数学形式和实现复杂度上的差异
本题已收录答题指导
本题附完整参考答案与评分标准
登录后可查看结构化答题指导;也可以直接开一场模拟面试,AI 面试官用本题实时追问并给出评分。