AI 简历
简历模板
简历范文
模拟面试
校招
求职攻略
关于我们
我要招人
登录
登录
AI 简历
简历模板
简历范文
模拟面试
校招
求职攻略
关于我们
我要招人
首页
面试题库
美团面试题
PPO/GRPO 微调后,如何防止模型在分布外(…
美团面试题
更新 2026-08-05
PPO/GRPO 微调后,如何防止模型在分布外(OOD)问题上性能崩塌?
美团
人工智能
互联网/IT
风险判断
技术原理
方案权衡
考察说明
考察对强化学习微调中分布偏移和性能退化问题的理解与防范策略
回答思路
解释微调导致OOD性能崩塌的机制,如策略偏移、奖励过拟合
提出基于KL散度或信任区域的约束方法,如PPO的clip机制
讨论使用参考模型或正则化手段保持通用能力
提及数据混合、评估监控和回滚策略
换一题
上一题
项目中用线程池了吗?怎么用的?
下一题
请描述 OSI 七层模型的各层名称及其主要功能。
本题还出现在
互联网/IT行业面试题
人工智能面试题