京东零售面试题更新 2026-08-05
在RLHF阶段,请讲讲DPO(Direct Preference Optimization)的训练数据是如何构成的?
京东零售人工智能电商数据驱动技术原理
回答思路
- 说明DPO数据包含提示词、偏好对及回答
- 阐述偏好数据(chosen/rejected)的来源与标注方式
- 解释DPO与标准RLHF在数据利用上的差异
- 能讨论数据质量对训练效果的影响
本题附完整参考答案与评分标准
登录后可查看结构化答题指导;也可以直接开一场模拟面试,AI 面试官用本题实时追问并给出评分。