高德地图面试题更新 2026-08-05

请分别说明DPO、PPO和SFT的训练原理、损失函数,以及各自的训练过程中涉及几个模型。

高德地图人工智能问题拆解技术原理方案权衡

考察说明

考察对主流大模型对齐训练方法原理与模型架构的理解

回答思路

  1. 准确区分SFT监督微调、PPO强化学习、DPO直接偏好优化的核心原理
  2. 正确描述各方法的损失函数形式及作用
  3. 说明训练过程中涉及模型数量(如SFT单模型、PPO需策略模型+参考模型+奖励模型+价值模型、DPO需策略模型+参考模型)
  4. 体现对DPO如何简化PPO、避免显式奖励模型的理解
本题已收录答题指导

本题附完整参考答案与评分标准

登录后可查看结构化答题指导;也可以直接开一场模拟面试,AI 面试官用本题实时追问并给出评分。