AI 简历
简历模板
简历范文
模拟面试
校招
求职攻略
关于我们
我要招人
登录
登录
AI 简历
简历模板
简历范文
模拟面试
校招
求职攻略
关于我们
我要招人
首页
面试题库
人工智能面试题
在GRPO训练中,KL散度控制得怎么样?
人工智能面试题
更新 2026-08-05
在GRPO训练中,KL散度控制得怎么样?
滴滴
高德地图
人工智能
技术原理
问题排查
考察说明
考察对GRPO中KL散度约束机制的理解与实际调优经验
回答思路
说明KL散度的作用与目标范围
描述实际训练中KL散度的观察值或趋势
关联KL与奖励模型的关系及对策略更新的影响
换一题
上一题
请介绍Adam优化器。
下一题
训练时loss暴增可能是什么原因,如何解决?
本题还出现在
滴滴面试题
高德地图面试题