互联网/IT行业面试题更新 2026-08-05

GRPO训练时使用的是旧策略采样得到的数据,为什么仍被称为在线策略(on-policy)算法?

美团人工智能互联网/IT技术原理

考察说明

考察对强化学习中在线策略、离线策略和数据采样来源等核心概念的理解,尤其是GRPO在PPO框架下的实际数据使用方式

回答思路

  1. 明确在线策略与离线策略的基本区别
  2. 说明GRPO采样数据来自当前策略的旧版本但目标仍是优化当前策略
  3. 解释重要性采样或截断机制如何弥补策略更新后的数据偏移
  4. 结合PPO或GRPO的具体训练流程说明数据新鲜度要求
本题已收录答题指导

本题附完整参考答案与评分标准

登录后可查看结构化答题指导;也可以直接开一场模拟面试,AI 面试官用本题实时追问并给出评分。