人工智能面试题更新 2026-08-05

如果训练数据只标注了最优 response(非 pair 形式),Reward Model 的损失函数该如何设计?

滴滴人工智能技术原理方案权衡

考察说明

考察对单一正样本场景下奖励建模的思路

回答思路

  1. 认识到单正样本缺少负反馈,需引入辅助策略
  2. 能给出基于正样本排名的损失设计
  3. 讨论借助生成模型构造负样本的方法
  4. 说明如何保持训练稳定性