教育/培训行业面试题更新 2026-08-05

RLHF 中 reward model 的训练数据通常是如何构建的?

网易有道人工智能教育/培训数据驱动技术原理

考察说明

考察对 RLHF 数据构建流程的理解

回答思路

  1. 说明偏好数据对(chosen/rejected)的来源
  2. 描述人工标注或自动收集的流程
  3. 提到数据规模、标注标准与质量控制
  4. 结合模型生成与筛选机制