百度面试题更新 2026-08-05

如何通过 vLLM 部署实现 2k tokens/s 的吞吐量?

百度人工智能专业服务性能优化风险判断系统设计vLLM

考察说明

考察对 vLLM 高性能推理架构和吞吐优化的理解

回答思路

  1. 说明 vLLM 的 PagedAttention 与连续批处理机制
  2. 讨论模型量化、并行策略和硬件配置对吞吐的影响
  3. 提出具体的监控调优手段验证吞吐目标