腾讯面试题更新 2026-08-05
介绍GRPO、PPO、DPO,分别需要几个模型,需要训练的是哪些?
腾讯人工智能互联网/IT技术原理方案权衡
考察说明
考察对主流强化学习与偏好优化算法在模型架构和训练目标上的核心理解
回答思路
- 准确说明PPO需要四个模型及其各自是否参与训练
- 准确说明DPO需要三个模型及训练目标函数
- 准确说明GRPO需要三个模型及简化Critic的机制
- 能区分策略梯度、价值函数、参考模型和奖励模型的不同作用
本题附完整参考答案与评分标准
登录后可查看结构化答题指导;也可以直接开一场模拟面试,AI 面试官用本题实时追问并给出评分。