AI 简历
简历模板
简历范文
模拟面试
校招
求职攻略
关于我们
我要招人
登录
登录
AI 简历
简历模板
简历范文
模拟面试
校招
求职攻略
关于我们
我要招人
首页
面试题库
人工智能面试题
DPO 和 GRPO 在优化目标上有什么区别?
人工智能面试题
更新 2026-08-05
DPO 和 GRPO 在优化目标上有什么区别?
网易有道
人工智能
教育/培训
技术原理
方案权衡
考察说明
对比两种偏好优化算法的目标函数与更新机制
回答思路
准确描述 DPO 通过隐式奖励将偏好直接转化为策略优化目标
准确描述 GRPO 基于组内相对奖励估计优势并更新策略
指出 GRPO 无需单独价值模型,DPO 需要参考模型
能说明两者在样本效率和稳定性上的差异
换一题
上一题
请介绍什么是长记忆,以及它在实际应用中如何发挥作用?
下一题
请介绍几种常见的稀疏注意力变体,并说明其核心思想与适用场景。
本题还出现在
教育/培训行业面试题
网易有道面试题