阿里巴巴面试题更新 2026-08-05

在项目中使用PPO算法强化学习时,为什么既需要reward model又需要critic model?

阿里巴巴人工智能电商项目复盘技术原理

考察说明

考察对强化学习PPO算法中奖励模型与价值网络作用的区分与理解

回答思路

  1. 能说明reward model提供奖励信号、critic model估计状态价值
  2. 能解释critic model用于计算优势函数、降低方差
  3. 能理解两者的训练目标与更新方式不同
  4. 能结合项目场景说明各自的作用与分工