互联网/IT行业面试题更新 2026-08-05

请介绍你对DeepSeek采用的GRPO(Group Relative Policy Optimization)训练方法的理解。

字节跳动人工智能互联网/IT持续改进技术原理技术选型

考察说明

考察对GRPO核心思想和相对比较优化机制的理解

回答思路

  1. 能说明GRPO与PPO的主要区别,即去掉Critic模型、基于组内相对奖励估计优势
  2. 能解释组内采样与基准归一化的基本流程
  3. 能结合DeepSeek-R1等公开信息说明GRPO在推理强化学习中的应用背景