京东面试题更新 2026-08-05

请介绍MLA(Multi-head Latent Attention)及其与KV Cache的关系。

京东人工智能电商技术原理技术选型方案权衡LLM

考察说明

考察对大模型注意力机制优化和推理缓存机制的理解

回答思路

  1. 解释MLA的核心思想:对Key和Value进行低秩压缩以共享缓存
  2. 说明KV Cache的作用:存储历史token的KV以减少重复计算
  3. 阐述MLA如何降低KV Cache内存占用和提升推理效率
  4. 对比GQA、MQA等其他注意力变体,体现方案权衡理解