电商行业面试题更新 2026-08-05
请分别说明 PPO、GRPO、DPO 的损失函数设计思路及主要区别。
京东人工智能电商技术原理方案权衡
考察说明
考察强化学习与偏好优化中三类主流算法的核心机制理解
回答思路
- 准确写出或描述 PPO 的 clipped surrogate 目标及其重要性采样修正
- 说明 GRPO 如何用组内相对优势替代 Critic 网络以降低方差
- 解释 DPO 如何将偏好学习转为分类损失,避免显式奖励建模与强化学习采样
- 对比三者在稳定性、计算开销和适用场景上的差异
本题附完整参考答案与评分标准
登录后可查看结构化答题指导;也可以直接开一场模拟面试,AI 面试官用本题实时追问并给出评分。