百度面试题更新 2026-08-05

在 Verl 框架中,奖励函数打分一般有哪几种实现方式?各自适用什么场景?

百度人工智能专业服务技术原理技术选型方案权衡

考察说明

考察对奖励来源多样性和场景适用性的掌握

回答思路

  1. 说明可使用规则型奖励函数实现确定性打分
  2. 描述应用奖励模型进行通用打分
  3. 指出也可结合两者或使用外部工具反馈
  4. 说明选择依据是任务可量化程度与数据可得性