AI 简历
简历模板
简历范文
模拟面试
校招
求职攻略
关于我们
我要招人
登录
登录
AI 简历
简历模板
简历范文
模拟面试
校招
求职攻略
关于我们
我要招人
首页
面试题库
人工智能面试题
在 GRPO 训练中,如果一组样本的优势得分(a…
人工智能面试题
更新 2026-08-05
在 GRPO 训练中,如果一组样本的优势得分(advantage)全部为 0 或 1(即无梯度或饱和),应如何处理?
同花顺
人工智能
金融
技术原理
问题排查
考察说明
考察对 GRPO 优势归一化与训练稳定的理解
回答思路
指出全 0 或全 1 时归一化会导致除零或异常梯度
说明应检查奖励信号质量与数据分组合理性
提出加噪声、调整分组、检查基线或改用别的归一化方法
能够结合实践经验说明处理边界
换一题
上一题
map和unordered_map的底层原理是什么?
下一题
请解释 Triplet Loss 的原理及其在训练中的应用。
本题还出现在
金融行业面试题
同花顺面试题