AI 简历
简历模板
简历范文
模拟面试
校招
求职攻略
关于我们
我要招人
登录
登录
AI 简历
简历模板
简历范文
模拟面试
校招
求职攻略
关于我们
我要招人
首页
面试题库
人工智能面试题
请比较 GRPO、PPO 和 DPO 这三种强化…
人工智能面试题
更新 2026-08-05
请比较 GRPO、PPO 和 DPO 这三种强化学习对齐方法的算法原理与适用场景。
京邦达
人工智能
物流/供应链
技术原理
技术选型
方案权衡
考察说明
考察对主流 RLHF 算法原理的理解、对比与选型能力
回答思路
能够准确说出 PPO 的 critic 价值网络与优势估计原理
能够解释 GRPO 如何去掉 critic 网络并基于组内相对奖励估计优势
能够说明 DPO 如何将 RL 优化转化为隐式奖励下的直接偏好优化
能够结合奖励建模、离线/在线、样本效率等维度对比三者适用场景
换一题
上一题
请结合 DeepSpeed 的三个 ZeRO 阶段,详细介绍其工作原理、内存优化方式及各自的适用场景。
下一题
相比基础的策略梯度方法,PPO算法有哪些特点和优点?
本题还出现在
物流/供应链行业面试题
京邦达面试题