AI 简历
简历模板
简历范文
模拟面试
校招
求职攻略
关于我们
我要招人
登录
登录
AI 简历
简历模板
简历范文
模拟面试
校招
求职攻略
关于我们
我要招人
首页
面试题库
人工智能面试题
请比较强化学习中 PPO、DPO 和 RGPO …
人工智能面试题
更新 2026-08-05
请比较强化学习中 PPO、DPO 和 RGPO 的异同,并说明各自的适用场景。
金蝶
人工智能
专业服务
技术原理
技术选型
方案权衡
考察说明
考察对三类强化学习算法的原理理解及场景判断
回答思路
准确说明 PPO 是基于策略梯度的在线算法,通过裁剪目标函数限制更新幅度
准确说明 DPO 是离线偏好优化,直接基于偏好数据优化策略,无需显式奖励模型
准确说明 RGPO 或结合组相对偏好优化的思路,并对比其与 DPO 的差异
结合具体任务分析各自的适用场景与局限
换一题
上一题
请分享你在 SFT(监督微调)调参方面的实践经验。
下一题
LLM推理时有哪些采样参数设置(如top-k、top-p),一般如何调整?
本题还出现在
专业服务行业面试题
金蝶面试题