字节跳动面试题更新 2026-08-05

如何估算一个7B模型在batch=1、seqlen=2048下的KV Cache显存占用?

字节跳动人工智能互联网/IT性能优化问题拆解技术原理

考察说明

考察根据模型架构进行量化显存估算的能力

回答思路

  1. 明确需要7B模型的层数和隐藏维度
  2. 说明每个token每层K和V各占多少字节(如float16为2字节)
  3. 正确代入公式计算,得出数值
  4. 区分KV Cache显存与模型参数显存
  5. 说明采用GQA/MQA时计算方法的调整