AI 简历
简历模板
简历范文
模拟面试
校招
求职攻略
关于我们
我要招人
登录
登录
AI 简历
简历模板
简历范文
模拟面试
校招
求职攻略
关于我们
我要招人
首页
面试题库
高德地图面试题
在DPO训练中,如果正负样本(即 chosen …
高德地图面试题
更新 2026-08-05
在DPO训练中,如果正负样本(即 chosen 和 rejected 回复)之间只有少量差异,通常会导致效果不佳。请分析原因并提出解决方法。
高德地图
人工智能
技术原理
方案权衡
问题排查
考察说明
考察对DPO算法中对比信号与噪声、模型区分能力的理解及优化策略
回答思路
指出少量差异导致对比信号弱、梯度噪声大
解释模型难以学出稳定偏好,可能过拟合或退化为随机
提出增大差异、使用更严格筛选、改进损失或引入辅助信号等方法
能结合实际实验说明调整效果
换一题
上一题
你为什么学计算机,为什么学前端?
下一题
请介绍 Spring 事务传播机制,并说明不同传播行为的使用场景。
本题还出现在
人工智能面试题