AI 简历
简历模板
简历范文
模拟面试
校招
求职攻略
关于我们
我要招人
登录
登录
AI 简历
简历模板
简历范文
模拟面试
校招
求职攻略
关于我们
我要招人
首页
面试题库
人工智能面试题
GRPO reward怎么设计的,出现过训崩的情…
人工智能面试题
更新 2026-08-05
GRPO reward怎么设计的,出现过训崩的情况吗?
北京智谱华章科技
人工智能
互联网/IT
风险判断
技术原理
考察说明
考察强化学习奖励设计能力与对训练不稳定性的理解
回答思路
说明GRPO奖励的组成与设计原则
解释训练崩溃的常见原因与检测方法
描述稳定训练的措施
换一题
上一题
请列举常见的图像边缘检测方法,并简要说明它们的原理和适用场景。
下一题
向 vector 容器逐个添加元素的过程中,内部发生了哪些变化?
本题还出现在
互联网/IT行业面试题
北京智谱华章科技面试题