AI 简历
简历模板
简历范文
模拟面试
校招
求职攻略
关于我们
我要招人
登录
登录
AI 简历
简历模板
简历范文
模拟面试
校招
求职攻略
关于我们
我要招人
首页
面试题库
专业服务行业面试题
多模态模型的DPO训练是如何进行的?如何构造偏好…
专业服务行业面试题
更新 2026-08-05
多模态模型的DPO训练是如何进行的?如何构造偏好数据?
百度
人工智能
专业服务
数据驱动
问题拆解
技术原理
考察说明
考察多模态偏好对齐的训练流程与数据构造方法
回答思路
说明多模态DPO的训练目标与优化对象
描述偏好对(chosen/rejected)的构造方式
讨论视觉与文本输入的配对及标注策略
提到奖励信号与参考模型的使用
换一题
上一题
请解释 HTTP 的 Accept 请求头的作用及其返回值。
下一题
量化加速方面有了解吗?解释一下vLLM。
本题还出现在
百度面试题
人工智能面试题