AI 简历
简历模板
简历范文
模拟面试
校招
求职攻略
关于我们
我要招人
登录
登录
AI 简历
简历模板
简历范文
模拟面试
校招
求职攻略
关于我们
我要招人
首页
面试题库
教育/培训行业面试题
DPO 和 GRPO 在优化目标上有什么区别?
教育/培训行业面试题
更新 2026-08-05
DPO 和 GRPO 在优化目标上有什么区别?
网易有道
人工智能
教育/培训
技术原理
方案权衡
考察说明
对比两种偏好优化算法的目标函数与更新机制
回答思路
准确描述 DPO 通过隐式奖励将偏好直接转化为策略优化目标
准确描述 GRPO 基于组内相对奖励估计优势并更新策略
指出 GRPO 无需单独价值模型,DPO 需要参考模型
能说明两者在样本效率和稳定性上的差异
换一题
上一题
做项目使用到哪些协议?请分别介绍HTTP、WebSocket和SSE的适用场景与区别。
下一题
请解释 JavaScript 中 null 和 undefined 的区别,以及 typeof null 的返回值。
本题还出现在
网易有道面试题
人工智能面试题