百度面试题更新 2026-08-05

多模态模型的DPO训练是如何进行的?如何构造偏好数据?

百度人工智能专业服务数据驱动问题拆解技术原理

考察说明

考察多模态偏好对齐的训练流程与数据构造方法

回答思路

  1. 说明多模态DPO的训练目标与优化对象
  2. 描述偏好对(chosen/rejected)的构造方式
  3. 讨论视觉与文本输入的配对及标注策略
  4. 提到奖励信号与参考模型的使用