百度面试题更新 2026-08-05

请介绍 Verl 框架中强化学习训练的整体数据流,包括 roll-out 生成、奖励函数打分以及优势与 loss 的计算顺序。

百度人工智能专业服务业务理解问题拆解技术原理

考察说明

考察对 Verl 框架数据处理和训练流程的整体理解和逻辑串联能力

回答思路

  1. 说明 roll-out 由策略模型与环境交互生成并存储
  2. 描述奖励模型或规则对样本打分的环节
  3. 解释 GAE 或类似方法计算优势的过程
  4. 说明策略 loss 与价值 loss 如何由优势驱动更新