在LLM对齐中,你如何看待DPO(Direct Preference Optimization)在价值对齐和安全性(safety)方面的表现与局限?
考察说明
考察对DPO原理及其在安全对齐中应用的深入理解和权衡能力
回答思路
- 能清晰解释DPO的基本原理及其与RLHF的差异
- 能讨论DPO在价值对齐上的优势,如训练稳定性、计算效率
- 能识别DPO在保证安全性方面的局限,如奖励过优化、分布外行为
- 能提出结合DPO与其他安全措施(如红队测试、规则约束)的改进思路
考察对DPO原理及其在安全对齐中应用的深入理解和权衡能力