人工智能面试题更新 2026-08-05

KL散度的超参数在GRPO中如何设计?包括系数大小、动态调整策略以及不同阶段的设置考量。

小红书人工智能专业服务问题拆解技术原理方案权衡

考察说明

考察对KL惩罚系数调参经验与理论依据的理解

回答思路

  1. 说明系数初始值选取的常见范围及依据
  2. 能讨论动态调整策略如递增或衰减
  3. 结合训练阶段和奖励尺度说明调整逻辑
  4. 能提及与参考模型质量相关的考量