AI 简历
简历模板
简历范文
模拟面试
校招
求职攻略
关于我们
我要招人
登录
登录
AI 简历
简历模板
简历范文
模拟面试
校招
求职攻略
关于我们
我要招人
首页
面试题库
百度面试题
多模态模型的DPO训练是如何进行的?如何构造偏好…
百度面试题
更新 2026-08-05
多模态模型的DPO训练是如何进行的?如何构造偏好数据?
百度
人工智能
专业服务
数据驱动
问题拆解
技术原理
考察说明
考察多模态偏好对齐的训练流程与数据构造方法
回答思路
说明多模态DPO的训练目标与优化对象
描述偏好对(chosen/rejected)的构造方式
讨论视觉与文本输入的配对及标注策略
提到奖励信号与参考模型的使用
换一题
上一题
Java中常见的线程安全类有哪些,并简述其实现原理。
下一题
一枚不均匀的硬币抛掷10次,出现了7次正面和3次反面。试用极大似然估计求下一次抛出正面的概率。
本题还出现在
专业服务行业面试题
人工智能面试题