Verl 框架为什么需要重新 forward 计算 log probs?
考察说明
考察对 Verl 框架中 PPO 训练流程的理解,特别是回放样本与当前策略不一致时概率计算的必要性
回答思路
- 说明在强化学习训练中需要计算旧策略和当前策略下的 log probs 以计算重要性比率
- 解释重新 forward 是为了获取当前策略下的 log probs,用于计算 PPO 的 clipped surrogate objective
- 提到 Verl 框架的 RLHF/GRPO 等训练流程中,回放缓冲区中的样本来自旧策略,需要重新计算以对齐
- 补充说明缓存 log probs 的策略以减少计算开销,但必须确保策略参数更新后重新计算