AI 简历
简历模板
简历范文
模拟面试
校招
求职攻略
关于我们
我要招人
登录
登录
AI 简历
简历模板
简历范文
模拟面试
校招
求职攻略
关于我们
我要招人
首页
面试题库
蚂蚁集团面试题
GRPO 与 PPO 在 KL 散度约束上有哪些…
蚂蚁集团面试题
更新 2026-08-05
GRPO 与 PPO 在 KL 散度约束上有哪些区别?
蚂蚁集团
人工智能
互联网/IT
技术原理
方案权衡
考察说明
考察对两种强化学习算法在策略优化中 KL 惩罚机制的理解
回答思路
能说明 PPO 通过 KL 惩罚或裁剪限制策略更新幅度
能说明 GRPO 基于组内相对优势以及分组内计算 KL 的方式
能对比两者在 KL 约束计算对象、作用位置与计算开销的差异
换一题
上一题
请谈谈数据治理的实践框架,比如如何覆盖模型治理、运行效率和任务合理性,以及跨层协作中的常见问题。
下一题
做过最有挫败感的事?
本题还出现在
互联网/IT行业面试题
人工智能面试题