AI 简历
简历模板
简历范文
模拟面试
校招
求职攻略
关于我们
我要招人
登录
登录
AI 简历
简历模板
简历范文
模拟面试
校招
求职攻略
关于我们
我要招人
首页
面试题库
人工智能面试题
PPO、DPO、GRPO 各自的优缺点是什么?
人工智能面试题
更新 2026-08-05
PPO、DPO、GRPO 各自的优缺点是什么?
滴滴
人工智能
技术原理
技术选型
方案权衡
考察说明
考察对主流强化学习与偏好优化算法的理解、比较与适用场景判断
回答思路
准确说明三种方法的优化目标和核心机制
分别指出其稳定性、样本效率、实现复杂度等优缺点
能结合具体应用场景说明选型理由
换一题
上一题
请介绍 Verl 框架中强化学习训练的整体数据流,包括 roll-out 生成、奖励函数打分以及优势与 loss 的计算顺序。
下一题
解释一下梯度消失的处理策略
本题还出现在
滴滴面试题