AI 简历
简历模板
简历范文
模拟面试
校招
求职攻略
关于我们
我要招人
登录
登录
AI 简历
简历模板
简历范文
模拟面试
校招
求职攻略
关于我们
我要招人
首页
面试题库
人工智能面试题
在强化学习训练中,选择 GRPO 而非 PPO …
人工智能面试题
更新 2026-08-05
在强化学习训练中,选择 GRPO 而非 PPO 或 DPO 的主要动机是什么?它解决了哪些核心问题?
美团
人工智能
互联网/IT
技术原理
方案权衡
考察说明
考察对 GRPO 与 PPO、DPO 差异的理解及选型逻辑
回答思路
能对比 GRPO 与 PPO 在 critic 模型依赖上的差异
能解释 GRPO 如何通过组内相对优势降低方差
能说明 GRPO 与 DPO 在优化目标和数据需求上的区别
能结合具体训练成本或稳定性问题说明选型理由
换一题
上一题
给定一张低照度图像和一张高质量参考图像,如何实现低照度图像增强?
下一题
在多Agent架构中,除了ReAct,还有哪些主流架构?
本题还出现在
互联网/IT行业面试题
美团面试题