阿里健康面试题更新 2026-08-05

在LLM对齐中,你如何看待DPO(Direct Preference Optimization)在价值对齐和安全性(safety)方面的表现与局限?

阿里健康人工智能消费品/零售风险判断技术原理方案权衡

考察说明

考察对DPO原理及其在安全对齐中应用的深入理解和权衡能力

回答思路

  1. 能清晰解释DPO的基本原理及其与RLHF的差异
  2. 能讨论DPO在价值对齐上的优势,如训练稳定性、计算效率
  3. 能识别DPO在保证安全性方面的局限,如奖励过优化、分布外行为
  4. 能提出结合DPO与其他安全措施(如红队测试、规则约束)的改进思路