人工智能面试题更新 2026-08-05
PPO(近端策略优化)和DPO有什么区别,什么时候选择?
哔哩哔哩人工智能技术原理技术选型方案权衡
考察说明
考察对两类强化学习/对齐优化算法的原理理解、适用场景与取舍能力
回答思路
- 准确说明PPO基于策略梯度与重要性采样,通过裁剪限制更新步长
- 准确说明DPO直接基于偏好数据优化策略,无需显式奖励模型和强化学习循环
- 对比两者在训练复杂度、稳定性、样本效率与超参数敏感性上的差异
- 能根据奖励模型可用性、数据形式、计算资源、稳定性需求给出选择建议
本题附完整参考答案与评分标准
登录后可查看结构化答题指导;也可以直接开一场模拟面试,AI 面试官用本题实时追问并给出评分。