阿里巴巴面试题更新 2026-08-05
讲解一下KL散度。PPO和GRPO的损失函数有哪些区别?
阿里巴巴人工智能电商技术原理方案权衡
考察说明
考察强化学习算法中KL散度概念及PPO与GRPO目标函数设计的理解
回答思路
- 准确解释KL散度的定义、非对称性和非负性
- 对比PPO的clip代理目标与KL惩罚机制
- 对比GRPO的组相对优势估计与KL约束方式
- 说明两种算法在计算效率和稳定性上的权衡
本题附完整参考答案与评分标准
登录后可查看结构化答题指导;也可以直接开一场模拟面试,AI 面试官用本题实时追问并给出评分。