电子/半导体行业面试题更新 2026-08-05
KV-Cache如何加速推理?
小米集团阿里云人工智能电子/半导体专业服务性能优化技术原理Transformer
考察说明
考察对Transformer推理中KV缓存机制及其加速原理的理解
回答思路
- 说明KV-Cache存储历史token的Key和Value
- 解释避免重复计算,减少推理计算量
- 指出内存开销与长序列限制
- 提及与prefill和decode阶段的关系
本题附完整参考答案与评分标准
登录后可查看结构化答题指导;也可以直接开一场模拟面试,AI 面试官用本题实时追问并给出评分。