DAPO 去掉 KL 散度约束并采用 clip-higher 机制,为什么不会导致模型训飞?这一设计是如何在训练稳定性上给出保证的?
考察说明
考察对 DAPO 强化学习算法中去 KL 约束与 clip-higher 机制的设计动机及其稳定性保障的理解
回答思路
- 能解释 DAPO 为何移除 KL 惩罚项及其对探索效率的影响
- 能说明 clip-higher 的渐进式裁剪如何限制策略更新幅度
- 能指出 token 级策略梯度裁剪、动态采样等配套机制对稳定性的协同作用
- 能结合损失函数形式说明其如何防止策略崩溃或熵塌缩