你了解 vLLM 的 prefix cache 机制是如何实现的吗?
考察说明
考察对大模型推理系统中前缀缓存原理和实现细节的理解
回答思路
- 解释 prefix cache 的核心目的:复用相同前缀的 KV cache,避免重复计算
- 说明基于前缀哈希或最长公共前缀匹配的缓存查找策略
- 能描述缓存命中、未命中时的处理流程,以及如何处理动态前缀(如系统提示词+用户输入)
- 提到相关实现细节,如 RadixTree 或哈希表、缓存淘汰策略(如 LFU/LRU)、与 PagedAttention 的关系
考察对大模型推理系统中前缀缓存原理和实现细节的理解