高德地图面试题更新 2026-08-05

在DPO训练中,如果正负样本(即 chosen 和 rejected 回复)之间只有少量差异,通常会导致效果不佳。请分析原因并提出解决方法。

高德地图人工智能技术原理方案权衡问题排查

考察说明

考察对DPO算法中对比信号与噪声、模型区分能力的理解及优化策略

回答思路

  1. 指出少量差异导致对比信号弱、梯度噪声大
  2. 解释模型难以学出稳定偏好,可能过拟合或退化为随机
  3. 提出增大差异、使用更严格筛选、改进损失或引入辅助信号等方法
  4. 能结合实际实验说明调整效果