深圳虾皮信息科技有限公司面试题更新 2026-08-05
讲讲PageAttention机制
深圳虾皮信息科技有限公司人工智能互联网/IT性能优化技术原理vLLM
考察说明
考察对vLLM中PagedAttention核心设计及其解决的问题的理解
回答思路
- 说明传统KV Cache连续内存分配导致的内部碎片和外部碎片
- 解释PagedAttention将KV Cache分块存储,按需分配,类似操作系统的分页管理
- 描述块内键值存储和块间索引表(block table)的映射关系
- 讨论其对吞吐量和显存利用率的提升效果及在推理中的实际意义
本题附完整参考答案与评分标准
登录后可查看结构化答题指导;也可以直接开一场模拟面试,AI 面试官用本题实时追问并给出评分。