AI 简历
简历模板
简历范文
模拟面试
校招
求职攻略
关于我们
我要招人
登录
登录
AI 简历
简历模板
简历范文
模拟面试
校招
求职攻略
关于我们
我要招人
首页
面试题库
人工智能行业面试题
在DPO(直接偏好优化)微调中,除了使用正则表达…
人工智能行业面试题
更新 2026-08-05
在DPO(直接偏好优化)微调中,除了使用正则表达式截断,还有哪些方法可以控制模型回答过长的问题?
MiniMax
人工智能
技术原理
方案权衡
问题排查
考察说明
考察对DPO训练数据构造与奖励模型限制的理解,以及长度控制的替代策略
回答思路
说明DPO中回答长度问题的来源是偏好数据中的长度偏差
提出调整偏好数据构造的多样性
提出在DPO损失中加入长度惩罚或正则项
提出推理阶段采用动态截断或生成参数控制
讨论长度归一化或奖励模型设计
换一题
上一题
HTTP/1.0 和 HTTP/2.0 的主要区别是什么?
下一题
常见的内存分配API有哪些,kmalloc、vmalloc、kmap这些有什么区别,底层是怎么实现的?
本题还出现在
MiniMax面试题
人工智能面试题