百度面试题更新 2026-08-05

在DAPO(如RLHF/RLVR中的在线策略优化)训练中,为什么对长思维链(long CoT)赋予更高权重或奖励会有助于提升最终性能?

百度人工智能专业服务风险判断技术原理方案权衡

考察说明

考察对强化学习奖励设计、探索空间与长推理生成之间关系的理解

回答思路

  1. 解释长CoT与探索/覆盖更多推理路径的关系
  2. 说明权重或奖励调整如何引导策略偏向更深入推理
  3. 讨论过长CoT的收益递减与稳定性风险
  4. 联系RLVR中过程奖励或结果奖励的实际作用