电商行业面试题更新 2026-08-05
在什么场景下适合使用 DPO(Direct Preference Optimization)来对齐语言模型?请结合约束条件说明理由。
京东人工智能电商技术原理技术选型方案权衡
回答思路
- 说明 DPO 适用于可直接获得偏好对或排序数据的场景
- 指出 DPO 无需显式奖励模型,节省训练开销
- 讨论对参考策略、在线采样和稳定性要求
- 能对比 RLHF 讲清楚 DPO 的边界
本题附完整参考答案与评分标准
登录后可查看结构化答题指导;也可以直接开一场模拟面试,AI 面试官用本题实时追问并给出评分。