教育/培训行业面试题更新 2026-08-05

RLHF 中 reward model 常用的损失函数(如 ranking loss)是什么?请说明其原理和公式。

网易有道人工智能教育/培训技术原理方案权衡

考察说明

考察对 RLHF 中奖励模型训练目标与排序损失原理的理解

回答思路

  1. 能写出排名损失(ranking loss)的公式并解释其作用
  2. 说明奖励模型为何采用成对比较而非绝对打分
  3. 解释对数 sigmoid 形式的由来及优化目标
  4. 结合实际说明训练数据构造(如两两比较/束内排序)
  5. 指出损失函数对奖励模型输出尺度的影响