后端岗位面试题更新 2026-08-05

prefill阶段有没有办法加快KV cache的生成?

卓驭后端开发人工智能性能优化技术原理方案权衡LLM

考察说明

考察对LLM推理prefill阶段性能优化的理解

回答思路

  1. 能解释prefill阶段KV cache生成是计算密集而非访存密集
  2. 能说明GQA/MQA、paged attention等对显存与速度的影响
  3. 能提到计算优化如算子融合、量化、并行策略
本题已收录答题指导

本题附完整参考答案与评分标准

登录后可查看结构化答题指导;也可以直接开一场模拟面试,AI 面试官用本题实时追问并给出评分。