请比较GRPO方法与PPO方法的区别。
考察说明
考察对强化学习优化算法的理解,尤其是策略梯度与组内奖励归一化的差异
回答思路
- 准确说明PPO的核心机制:基于单个轨迹的GAE、价值网络估计优势、裁剪目标限制策略更新
- 准确说明GRPO的核心机制:组内采样多个输出、用组内奖励的均值与标准差做归一化获得优势、不单独训练价值网络
- 对比两者的计算开销与内存占用:PPO需要价值网络与优势估计,GRPO省去价值网络、用组统计归一化
- 讨论适用场景:PPO适合需要精确优势估计的连续或复杂奖励环境,GRPO更适合奖励模型明确、可批量采样的生成或数学推理任务
本题已收录答题指导
本题附完整参考答案与评分标准
登录后可查看结构化答题指导;也可以直接开一场模拟面试,AI 面试官用本题实时追问并给出评分。