360集团面试题更新 2026-08-05

请比较GRPO方法与PPO方法的区别。

360集团人工智能互联网/IT技术原理方案权衡

考察说明

考察对强化学习优化算法的理解,尤其是策略梯度与组内奖励归一化的差异

回答思路

  1. 准确说明PPO的核心机制:基于单个轨迹的GAE、价值网络估计优势、裁剪目标限制策略更新
  2. 准确说明GRPO的核心机制:组内采样多个输出、用组内奖励的均值与标准差做归一化获得优势、不单独训练价值网络
  3. 对比两者的计算开销与内存占用:PPO需要价值网络与优势估计,GRPO省去价值网络、用组统计归一化
  4. 讨论适用场景:PPO适合需要精确优势估计的连续或复杂奖励环境,GRPO更适合奖励模型明确、可批量采样的生成或数学推理任务
本题已收录答题指导

本题附完整参考答案与评分标准

登录后可查看结构化答题指导;也可以直接开一场模拟面试,AI 面试官用本题实时追问并给出评分。