AI 简历
简历模板
简历范文
模拟面试
校招
求职攻略
关于我们
我要招人
登录
登录
AI 简历
简历模板
简历范文
模拟面试
校招
求职攻略
关于我们
我要招人
首页
面试题库
互联网/IT行业面试题
如果在训练 DPO 的过程中,正例和负例的 lo…
互联网/IT行业面试题
更新 2026-08-05
如果在训练 DPO 的过程中,正例和负例的 loss 都在下降,该如何解决?
美团
百度
人工智能
互联网/IT
专业服务
性能优化
技术原理
问题排查
考察说明
考察对 DPO 训练动态的理解和调试能力
回答思路
解释 DPO 中正负例 loss 下降的可能原因
提出监控指标(如 margin、隐层表征)来判断问题
给出针对性调整策略(如学习率、正则化、数据采样)
体现对 DPO 目标与 RLHF 差异的理解
换一题
上一题
BitMap底层是怎么做的?有什么优势?
下一题
如果初始化 HashMap 时指定容量为 5,实际数组大小是多少?下一次扩容后是多少?
本题还出现在
专业服务行业面试题
美团面试题
百度面试题
人工智能面试题