美团面试题更新 2026-08-05

Verl 框架为什么需要重新 forward 计算 log probs?

美团人工智能互联网/IT问题拆解技术原理

考察说明

考察对 Verl 框架中 PPO 训练流程的理解,特别是回放样本与当前策略不一致时概率计算的必要性

回答思路

  1. 说明在强化学习训练中需要计算旧策略和当前策略下的 log probs 以计算重要性比率
  2. 解释重新 forward 是为了获取当前策略下的 log probs,用于计算 PPO 的 clipped surrogate objective
  3. 提到 Verl 框架的 RLHF/GRPO 等训练流程中,回放缓冲区中的样本来自旧策略,需要重新计算以对齐
  4. 补充说明缓存 log probs 的策略以减少计算开销,但必须确保策略参数更新后重新计算