腾讯面试题更新 2026-08-05

DPO阶段相比SFT阶段数据和模型分布的区别

腾讯人工智能互联网/IT问题拆解技术原理

考察说明

考察对RLHF后训练流程中SFT与DPO阶段数据样本和模型分布差异的理解

回答思路

  1. 能对比SFT与DPO训练数据的来源、格式和标注方式
  2. 能说明SFT与DPO训练时模型参数分布或行为分布的变化
  3. 能解释DPO中偏好对拒绝采样的影响
  4. 能指出DPO直接优化策略与SFT最大似然估计的本质区别