阿里巴巴面试题更新 2026-08-05

讲一下RLHF的流程,并写出PPO和DPO的Loss表达式。

阿里巴巴人工智能电商编码实现技术原理

考察说明

考察对RLHF整体流程的理解以及PPO与DPO算法损失函数的掌握

回答思路

  1. 能清晰描述RLHF的三个阶段:SFT、奖励模型训练、强化学习优化
  2. 能给出PPO损失包含策略梯度、价值函数、熵正则等部分的公式
  3. 能正确给出DPO损失基于偏好对的闭式表达式
  4. 能说明PPO与DPO在目标和训练方式上的核心差异