互联网/IT行业面试题更新 2026-08-05

R1的 MLA是如何节约 KV cache 的?

美团小红书人工智能互联网/IT专业服务技术原理方案权衡

考察说明

考察对MLA机制原理的理解及KV cache压缩思路

回答思路

  1. 能准确说明MLA通过低秩联合压缩KV来减少缓存
  2. 能解释解耦RoPE与缓存压缩的兼容处理
  3. 能指出相比标准MHA在推理显存上的收益