美团面试题更新 2026-08-05

PPO/GRPO 微调后,如何防止模型在分布外(OOD)问题上性能崩塌?

美团人工智能互联网/IT风险判断技术原理方案权衡

考察说明

考察对强化学习微调中分布偏移和性能退化问题的理解与防范策略

回答思路

  1. 解释微调导致OOD性能崩塌的机制,如策略偏移、奖励过拟合
  2. 提出基于KL散度或信任区域的约束方法,如PPO的clip机制
  3. 讨论使用参考模型或正则化手段保持通用能力
  4. 提及数据混合、评估监控和回滚策略