金融行业面试题更新 2026-08-05

在 GRPO 训练中,如果一组样本的优势得分(advantage)全部为 0 或 1(即无梯度或饱和),应如何处理?

同花顺人工智能金融技术原理问题排查

考察说明

考察对 GRPO 优势归一化与训练稳定的理解

回答思路

  1. 指出全 0 或全 1 时归一化会导致除零或异常梯度
  2. 说明应检查奖励信号质量与数据分组合理性
  3. 提出加噪声、调整分组、检查基线或改用别的归一化方法
  4. 能够结合实践经验说明处理边界