电商行业面试题更新 2026-08-05
请解释GRPO、PPO和DPO在模型对齐中的区别及应用方式。
飞猪人工智能电商技术原理方案权衡
考察说明
考察对主流对齐算法的原理、适用场景和实现差异的理解
回答思路
- 明确各算法优化目标和奖励建模方式
- 说明PPO的critic与GRPO去除critic的差异
- 解释DPO如何用偏好数据直接优化策略
- 结合训练稳定性和计算成本比较应用场景
本题附完整参考答案与评分标准
登录后可查看结构化答题指导;也可以直接开一场模拟面试,AI 面试官用本题实时追问并给出评分。