美团面试题 · tech:vllm
美团相关面试题,按最终去重题目聚合。
共 3614 道真题 · 当前筛选命中 7 道 · 更新 2026-08-05
筛选题目已选:tech:vllm
考察点
技术栈
第 1 题在 vLLM 部署中,如何实现 2k tokens/s 的吞吐? 考察对 vLLM 性能优化手段和吞吐瓶颈的理解第 2 题我们做了一些multi-query attention优化,但发现decoder延迟还是高,你觉得是哪里的瓶颈?vLLM本身的KV cache是不是反而是负担 考察对LLM推理延迟瓶颈的系统性分析和KV cache作用的理解第 3 题接触过哪些推理加速的方法? 考察对大模型推理加速核心技术的理解深度与实践经验第 4 题你了解 vLLM 的 prefix cache 机制是如何实现的吗? 考察对大模型推理系统中前缀缓存原理和实现细节的理解第 5 题你在项目中部署大模型时选用了什么推理框架(如 vLLM、TGI 或自研)?选择的理由是什么? 考察推理框架选型依据与业务适配能力第 6 题VLLM prefix cache实现过吗?讲一下你的理解。 考察对VLLM prefix cache机制、实现原理及优化场景的理解第 7 题模型部署使用了什么推理框架(如 vLLM、TGI 或自研框架),选择该框架的原因是什么? 考察对主流推理框架的了解、选型依据和部署实践经验