AI 简历
简历模板
简历范文
模拟面试
校招
求职攻略
关于我们
我要招人
登录
登录
AI 简历
简历模板
简历范文
模拟面试
校招
求职攻略
关于我们
我要招人
首页
面试题库
网易有道面试题
DPO 和 GRPO 在优化目标上有什么区别?
网易有道面试题
更新 2026-08-05
DPO 和 GRPO 在优化目标上有什么区别?
网易有道
人工智能
教育/培训
技术原理
方案权衡
考察说明
对比两种偏好优化算法的目标函数与更新机制
回答思路
准确描述 DPO 通过隐式奖励将偏好直接转化为策略优化目标
准确描述 GRPO 基于组内相对奖励估计优势并更新策略
指出 GRPO 无需单独价值模型,DPO 需要参考模型
能说明两者在样本效率和稳定性上的差异
换一题
上一题
消息丢失、消息重复消费分别如何解决?
下一题
实习中遇到最有挑战的事情是什么?你是如何解决的?
本题还出现在
教育/培训行业面试题
人工智能面试题