阿里巴巴面试题更新 2026-08-05
请介绍RLHF的基本流程,并写出PPO和DPO的损失函数表达式。
阿里巴巴人工智能电商技术原理
考察说明
考察对RLHF流程的完整理解以及对PPO和DPO损失函数细节的掌握
回答思路
- 说明RLHF的三阶段流程:监督微调、奖励模型训练、强化学习优化
- 正确写出PPO的损失表达式并解释各项含义与作用
- 正确写出DPO的损失表达式并解释其如何简化RLHF
- 对比PPO与DPO的异同及适用场景
本题附完整参考答案与评分标准
登录后可查看结构化答题指导;也可以直接开一场模拟面试,AI 面试官用本题实时追问并给出评分。