AI 简历
简历模板
简历范文
模拟面试
校招
求职攻略
关于我们
我要招人
登录
登录
AI 简历
简历模板
简历范文
模拟面试
校招
求职攻略
关于我们
我要招人
首页
面试题库
人工智能面试题
讲一下RLHF的流程,并写出PPO和DPO的Lo…
人工智能面试题
更新 2026-08-05
讲一下RLHF的流程,并写出PPO和DPO的Loss表达式。
阿里巴巴
人工智能
电商
编码实现
技术原理
考察说明
考察对RLHF整体流程的理解以及PPO与DPO算法损失函数的掌握
回答思路
能清晰描述RLHF的三个阶段:SFT、奖励模型训练、强化学习优化
能给出PPO损失包含策略梯度、价值函数、熵正则等部分的公式
能正确给出DPO损失基于偏好对的闭式表达式
能说明PPO与DPO在目标和训练方式上的核心差异
换一题
上一题
请讲解LoRA的原理细节,为什么它能实现对大规模语言模型的参数高效微调?
下一题
大模型输入长度如何提升
本题还出现在
电商行业面试题
阿里巴巴面试题