AI 简历
简历模板
简历范文
模拟面试
校招
求职攻略
关于我们
我要招人
登录
登录
AI 简历
简历模板
简历范文
模拟面试
校招
求职攻略
关于我们
我要招人
首页
面试题库
MiniMax面试题
在DPO(直接偏好优化)微调中,除了使用正则表达…
MiniMax面试题
更新 2026-08-05
在DPO(直接偏好优化)微调中,除了使用正则表达式截断,还有哪些方法可以控制模型回答过长的问题?
MiniMax
人工智能
技术原理
方案权衡
问题排查
考察说明
考察对DPO训练数据构造与奖励模型限制的理解,以及长度控制的替代策略
回答思路
说明DPO中回答长度问题的来源是偏好数据中的长度偏差
提出调整偏好数据构造的多样性
提出在DPO损失中加入长度惩罚或正则项
提出推理阶段采用动态截断或生成参数控制
讨论长度归一化或奖励模型设计
换一题
上一题
请介绍 Redis 的核心数据结构及其典型应用场景。
下一题
给定一个二维数组,每个子数组长度可能不同,如何实现回溯算法生成所有可能的组合,例如输入 [[1,2,3],[4,5],[6,7,8]] 输出 [[1,4,6],[1,4,7],[1,4,8],...]?请写出代码思路并分析复杂度。
本题还出现在
人工智能行业面试题
人工智能面试题