AI 简历
简历模板
简历范文
模拟面试
校招
求职攻略
关于我们
我要招人
登录
登录
AI 简历
简历模板
简历范文
模拟面试
校招
求职攻略
关于我们
我要招人
首页
面试题库
人工智能面试题
RLHF中损失函数如何计算?请重点说明PPO阶段…
人工智能面试题
更新 2026-08-05
RLHF中损失函数如何计算?请重点说明PPO阶段和奖励模型训练阶段的损失计算方式。
巨人网络
人工智能
游戏
编码实现
技术原理
考察说明
考察对RLHF中损失函数细节的掌握
回答思路
奖励模型训练:对比损失或回归损失,如Pairwise ranking loss
PPO阶段:组合策略梯度损失、价值损失和KL惩罚项
说明各项损失的具体形式如L_CLIP、L_VF、L_KL
换一题
上一题
请写出Transformer中自注意力的表达式,并解释为什么要除以√dk。
下一题
请介绍一下你的硕士毕业论文研究内容,使用了什么算法,相比已有方法有哪些提升?
本题还出现在
游戏行业面试题
巨人网络面试题