人工智能面试题更新 2026-08-05

你了解 vLLM 的 prefix cache 机制是如何实现的吗?

美团人工智能互联网/IT问题拆解系统设计技术原理vLLM

考察说明

考察对大模型推理系统中前缀缓存原理和实现细节的理解

回答思路

  1. 解释 prefix cache 的核心目的:复用相同前缀的 KV cache,避免重复计算
  2. 说明基于前缀哈希或最长公共前缀匹配的缓存查找策略
  3. 能描述缓存命中、未命中时的处理流程,以及如何处理动态前缀(如系统提示词+用户输入)
  4. 提到相关实现细节,如 RadixTree 或哈希表、缓存淘汰策略(如 LFU/LRU)、与 PagedAttention 的关系