人工智能行业面试题更新 2026-08-05

在DPO(直接偏好优化)微调中,除了使用正则表达式截断,还有哪些方法可以控制模型回答过长的问题?

MiniMax人工智能技术原理方案权衡问题排查

考察说明

考察对DPO训练数据构造与奖励模型限制的理解,以及长度控制的替代策略

回答思路

  1. 说明DPO中回答长度问题的来源是偏好数据中的长度偏差
  2. 提出调整偏好数据构造的多样性
  3. 提出在DPO损失中加入长度惩罚或正则项
  4. 提出推理阶段采用动态截断或生成参数控制
  5. 讨论长度归一化或奖励模型设计