深圳虾皮信息科技有限公司面试题更新 2026-08-05

讲讲PageAttention机制

深圳虾皮信息科技有限公司人工智能互联网/IT性能优化技术原理vLLM

考察说明

考察对vLLM中PagedAttention核心设计及其解决的问题的理解

回答思路

  1. 说明传统KV Cache连续内存分配导致的内部碎片和外部碎片
  2. 解释PagedAttention将KV Cache分块存储,按需分配,类似操作系统的分页管理
  3. 描述块内键值存储和块间索引表(block table)的映射关系
  4. 讨论其对吞吐量和显存利用率的提升效果及在推理中的实际意义
本题已收录答题指导

本题附完整参考答案与评分标准

登录后可查看结构化答题指导;也可以直接开一场模拟面试,AI 面试官用本题实时追问并给出评分。