AI 简历
简历模板
简历范文
模拟面试
校招
求职攻略
关于我们
我要招人
登录
登录
AI 简历
简历模板
简历范文
模拟面试
校招
求职攻略
关于我们
我要招人
首页
面试题库
人工智能面试题
多模态模型的DPO训练是如何进行的?如何构造偏好…
人工智能面试题
更新 2026-08-05
多模态模型的DPO训练是如何进行的?如何构造偏好数据?
百度
人工智能
专业服务
数据驱动
问题拆解
技术原理
考察说明
考察多模态偏好对齐的训练流程与数据构造方法
回答思路
说明多模态DPO的训练目标与优化对象
描述偏好对(chosen/rejected)的构造方式
讨论视觉与文本输入的配对及标注策略
提到奖励信号与参考模型的使用
换一题
上一题
dense类的特征可以拿来做embedding吗?
下一题
多轮对话训练中如何处理对话轮数?请说明多轮训练数据拆分的技巧、背后的原因,以及训练与推理阶段处理是否一致。
本题还出现在
专业服务行业面试题
百度面试题