AI 简历
简历模板
简历范文
模拟面试
校招
求职攻略
关于我们
我要招人
登录
登录
AI 简历
简历模板
简历范文
模拟面试
校招
求职攻略
关于我们
我要招人
首页
面试题库
人工智能面试题
KL散度的超参数在GRPO中如何设计?包括系数大…
人工智能面试题
更新 2026-08-05
KL散度的超参数在GRPO中如何设计?包括系数大小、动态调整策略以及不同阶段的设置考量。
小红书
人工智能
专业服务
问题拆解
技术原理
方案权衡
考察说明
考察对KL惩罚系数调参经验与理论依据的理解
回答思路
说明系数初始值选取的常见范围及依据
能讨论动态调整策略如递增或衰减
结合训练阶段和奖励尺度说明调整逻辑
能提及与参考模型质量相关的考量
换一题
上一题
RoBERTa做了哪些改进?
下一题
在 SFT 阶段,你们如何设计不同来源数据(如通用指令、垂域问答、CoT 数据)的配比?依据是什么?
本题还出现在
专业服务行业面试题
小红书面试题