在 GRPO 训练中,是否应该更新用于生成 rollout 的模型(即参考模型 ref model)?
考察说明
考察对 GRPO 算法中参考模型作用及更新策略的理解
回答思路
- 能说明 GRPO 中参考模型(ref model)的用途,即固定用于计算 KL 散度或作为 baseline
- 能解释为什么 rollout 模型通常不更新:更新会影响训练稳定性和策略梯度估计
- 能结合具体实现说明 ref model 与策略模型(policy)的关系,比如是否共享参数
本题已收录答题指导
本题附完整参考答案与评分标准
登录后可查看结构化答题指导;也可以直接开一场模拟面试,AI 面试官用本题实时追问并给出评分。