淘天集团面试题更新 2026-08-05
SFT和DPO的区别是什么?
淘天集团滴滴人工智能互联网/IT技术原理方案权衡
考察说明
考察对模型训练阶段与偏好对齐方法的理解,包括目标、数据、机制和效果差异
回答思路
- 说明SFT是有监督微调,用于使模型学习指令跟随或领域格式
- 说明DPO是偏好优化,通过对比偏好对直接优化策略
- 对比两者的训练目标、数据需求和计算开销
- 说明DPO基于Bradley-Terry模型,不需要显式奖励模型,SFT需要标注数据
- 讨论两者在实践中的关系,DPO通常在SFT之后进行
本题附完整参考答案与评分标准
登录后可查看结构化答题指导;也可以直接开一场模拟面试,AI 面试官用本题实时追问并给出评分。