AI 简历
简历模板
简历范文
模拟面试
校招
求职攻略
关于我们
我要招人
登录
登录
AI 简历
简历模板
简历范文
模拟面试
校招
求职攻略
关于我们
我要招人
首页
面试题库
人工智能面试题
在GRPO算法中,KL散度约束与之前PPO等算法…
人工智能面试题
更新 2026-08-05
在GRPO算法中,KL散度约束与之前PPO等算法中的KL惩罚方法有什么区别?
蚂蚁集团
人工智能
互联网/IT
技术原理
方案权衡
考察说明
考察对强化学习算法中KL散度约束机制演进的理解
回答思路
明确GRPO中KL散度的使用位置和作用
对比PPO等算法中KL散度作为惩罚项与GRPO的差异
说明KL散度约束在策略优化中的目的
指出计算方式或控制方式上的关键区别
换一题
上一题
代码题:如何用 rand7 实现 rand10?
下一题
请介绍大模型中的奖励模型(Reward Model)及其在训练中的作用。
本题还出现在
互联网/IT行业面试题
蚂蚁集团面试题