京东零售面试题更新 2026-08-05

在RLHF阶段,请讲讲DPO(Direct Preference Optimization)的训练数据是如何构成的?

京东零售人工智能电商数据驱动技术原理

考察说明

考察对DPO方法原理及偏好数据构造的理解

回答思路

  1. 说明DPO数据包含提示词、偏好对及回答
  2. 阐述偏好数据(chosen/rejected)的来源与标注方式
  3. 解释DPO与标准RLHF在数据利用上的差异
  4. 能讨论数据质量对训练效果的影响
本题已收录答题指导

本题附完整参考答案与评分标准

登录后可查看结构化答题指导;也可以直接开一场模拟面试,AI 面试官用本题实时追问并给出评分。