人工智能面试题更新 2026-08-05

请详细说明 Verl 框架用于强化学习训练时的整体流程,并解释配置文件中的 rollout_batch_size、global_batch_size、micro_batch_size_per_device_for_update 以及 rollout.n 等参数之间的关系,以及它们如何影响每次更新时每张显卡上的样本数量。

蚂蚁集团人工智能互联网/IT性能优化系统设计技术原理

考察说明

考察对 Verl 框架训练流程的理解及关键批次参数对显存与训练动态的影响

回答思路

  1. 能清晰描述 Verl 的 rollout、critic 更新、policy 更新等主要阶段
  2. 准确解释 rollout_batch_size、global_batch_size、micro_batch_size_per_device_for_update 的定义与作用
  3. 说明 rollout.n 与 rollout_batch_size 的换算关系
  4. 能推导或说明这些参数如何共同决定每张显卡上的有效样本数
  5. 能结合实际训练场景说明参数调整对显存占用、吞吐及训练稳定性的影响