互联网/IT行业面试题更新 2026-08-05
GRPO训练时使用的是旧策略采样得到的数据,为什么仍被称为在线策略(on-policy)算法?
美团人工智能互联网/IT技术原理
考察说明
考察对强化学习中在线策略、离线策略和数据采样来源等核心概念的理解,尤其是GRPO在PPO框架下的实际数据使用方式
回答思路
- 明确在线策略与离线策略的基本区别
- 说明GRPO采样数据来自当前策略的旧版本但目标仍是优化当前策略
- 解释重要性采样或截断机制如何弥补策略更新后的数据偏移
- 结合PPO或GRPO的具体训练流程说明数据新鲜度要求
本题附完整参考答案与评分标准
登录后可查看结构化答题指导;也可以直接开一场模拟面试,AI 面试官用本题实时追问并给出评分。