腾讯面试题更新 2026-08-05

在GRPO训练中,奖励模型是如何设计的?请说明其设计思路和原因。

腾讯人工智能互联网/IT技术原理方案权衡

考察说明

考察对GRPO奖励设计原理、组成部分及动机的理解

回答思路

  1. 能明确指出GRPO通常采用规则奖励而非学习式的奖励模型
  2. 能解释为何这样设计:简单、稳定、可解释
  3. 能结合具体任务举例说明奖励项的设定
  4. 能分析不同奖励设计对训练效果的影响