AI 简历
简历模板
简历范文
模拟面试
校招
求职攻略
关于我们
我要招人
登录
登录
AI 简历
简历模板
简历范文
模拟面试
校招
求职攻略
关于我们
我要招人
首页
面试题库
互联网/IT行业面试题
GRPO reward怎么设计的,出现过训崩的情…
互联网/IT行业面试题
更新 2026-08-05
GRPO reward怎么设计的,出现过训崩的情况吗?
北京智谱华章科技
人工智能
互联网/IT
风险判断
技术原理
考察说明
考察强化学习奖励设计能力与对训练不稳定性的理解
回答思路
说明GRPO奖励的组成与设计原则
解释训练崩溃的常见原因与检测方法
描述稳定训练的措施
换一题
上一题
请解释一下大模型训练中SFT(监督微调)的冷启动问题是什么,以及如何缓解?
下一题
有用过哪些微服务组件,具体干嘛的?
本题还出现在
北京智谱华章科技面试题
人工智能面试题