后端岗位面试题更新 2026-08-05
prefill阶段有没有办法加快KV cache的生成?
卓驭后端开发人工智能性能优化技术原理方案权衡LLM
考察说明
考察对LLM推理prefill阶段性能优化的理解
回答思路
- 能解释prefill阶段KV cache生成是计算密集而非访存密集
- 能说明GQA/MQA、paged attention等对显存与速度的影响
- 能提到计算优化如算子融合、量化、并行策略
本题附完整参考答案与评分标准
登录后可查看结构化答题指导;也可以直接开一场模拟面试,AI 面试官用本题实时追问并给出评分。