滴滴面试题更新 2026-08-05
你提到用 GRPO 而非 DPO,请对比两者损失函数形式,并解释 GRPO 在训练稳定性上的优势。
滴滴人工智能技术原理方案权衡
考察说明
考察对 GRPO 与 DPO 算法原理的理解、差异对比及实际应用判断
回答思路
- 能准确写出 DPO 的隐式奖励建模与损失函数核心
- 能准确描述 GRPO 基于组内相对优势的损失设计
- 能结合参考模型、基线或方差缩减解释 GRPO 稳定性优势
- 能指出两者适用场景差异
本题附完整参考答案与评分标准
登录后可查看结构化答题指导;也可以直接开一场模拟面试,AI 面试官用本题实时追问并给出评分。