人工智能面试题更新 2026-08-05
GRPO 与 PPO 在强化学习算法设计上的主要区别有哪些?
京东人工智能电商技术原理方案权衡PyTorch
考察说明
考察对 GRPO 与 PPO 核心机制差异的理解
回答思路
- 指出 PPO 使用 critic 网络估计状态价值,GRPO 去除 critic 并基于组内相对优势
- 说明 GRPO 通过组内采样计算基线,降低方差且减少内存开销
- 提及 PPO 的 clip 目标与 GRPO 的组内归一化优势函数的不同
- 能讨论二者在 RLHF 或大模型训练中的适用场景差异
本题附完整参考答案与评分标准
登录后可查看结构化答题指导;也可以直接开一场模拟面试,AI 面试官用本题实时追问并给出评分。