AI 简历
简历模板
简历范文
模拟面试
校招
求职攻略
关于我们
我要招人
登录
登录
AI 简历
简历模板
简历范文
模拟面试
校招
求职攻略
关于我们
我要招人
首页
面试题库
金融行业面试题
在 GRPO 训练中,如果一组样本的优势得分(a…
金融行业面试题
更新 2026-08-05
在 GRPO 训练中,如果一组样本的优势得分(advantage)全部为 0 或 1(即无梯度或饱和),应如何处理?
同花顺
人工智能
金融
技术原理
问题排查
考察说明
考察对 GRPO 优势归一化与训练稳定的理解
回答思路
指出全 0 或全 1 时归一化会导致除零或异常梯度
说明应检查奖励信号质量与数据分组合理性
提出加噪声、调整分组、检查基线或改用别的归一化方法
能够结合实践经验说明处理边界
换一题
上一题
谈谈你对测试开发岗位的理解。
下一题
git提交时出现冲突如何处理?
本题还出现在
同花顺面试题
人工智能面试题