AI 简历
简历模板
简历范文
模拟面试
校招
求职攻略
关于我们
我要招人
登录
登录
AI 简历
简历模板
简历范文
模拟面试
校招
求职攻略
关于我们
我要招人
首页
面试题库
汽车行业面试题
请比较 DPO、PPO 和 GRPO 三种强化学…
汽车行业面试题
更新 2026-08-05
请比较 DPO、PPO 和 GRPO 三种强化学习/偏好优化方法在训练大语言模型时的适用场景与差异。
美团
蔚来
人工智能
互联网/IT
汽车
技术原理
方案权衡
考察说明
考察对主流偏好优化方法原理与适用场景的理解
回答思路
准确说明 PPO 是带评论家的策略梯度方法及其在 RLHF 中的应用
准确说明 DPO 直接基于偏好数据优化策略、无需显式奖励模型
准确说明 GRPO 在 PPO 基础上去除批评家、使用组内相对优势
能结合训练稳定性、计算成本、样本效率说明三者取舍
换一题
上一题
请介绍一个你负责的项目,并说明其中最具挑战的技术难点及你的解决思路。
下一题
请现场共享屏幕,创建一个 Vue3 项目,实现一个父组件和两个子组件:分别通过插槽(插入)和 props 传递数据,并绑定动态响应式方法,完成一个最小可运行的项目。
本题还出现在
互联网/IT行业面试题
美团面试题
蔚来面试题
人工智能面试题