后端岗位面试题更新 2026-08-05

请描述大语言模型推理中 KV Cache 的管理机制,包括其作用、内存占用与优化策略。

中科曙光后端开发电子/半导体性能优化技术原理Transformer

考察说明

考察对 Transformer 推理中 KV Cache 原理、内存管理与优化方法的理解

回答思路

  1. 准确说明 KV Cache 的缓存内容与降低计算冗余的作用
  2. 分析其内存占用随序列长度增长的原因
  3. 列出常见优化手段如 PagedAttention、KV 量化、滑动窗口等
  4. 讨论与推理吞吐、延迟的权衡