物流/供应链行业面试题更新 2026-08-05

在强化学习训练大语言模型时,PPO 和 GRPO 分别适用于哪些场景?请说明各自的适用条件与选择依据。

京邦达人工智能物流/供应链技术原理技术选型方案权衡

考察说明

考察对两种强化学习算法的适用场景、相对优劣及选择依据的理解

回答思路

  1. 能明确区分 PPO 与 GRPO 的核心机制差异,如 critic 模型与组内基线
  2. 能结合资源约束、训练稳定性、任务特性说明选择理由
  3. 能指出 GRPO 对内存和计算成本的降低及其适用边界
  4. 能提及 PPO 在需要价值函数辅助或异质任务中的优势