腾讯面试题更新 2026-08-05

DeepSeek 使用的 GRPO 相比于 OpenAI 的 PPO 做了哪些改进?

腾讯人工智能互联网/IT技术原理方案权衡

考察说明

考察对 GRPO 与 PPO 差异的理解,验证对前沿强化学习训练的认知

回答思路

  1. 说明 PPO 依赖 Critic 模型估计优势函数
  2. 说明 GRPO 使用组内相对得分取代 Critic 网络
  3. 提到减少内存与计算开销、简化训练流程
  4. 能提到 GRPO 适合 LLM 场景的稀疏奖励