AI 简历
简历模板
简历范文
模拟面试
校招
求职攻略
关于我们
我要招人
登录
登录
AI 简历
简历模板
简历范文
模拟面试
校招
求职攻略
关于我们
我要招人
首页
面试题库
百度面试题
如何通过 vLLM 部署实现 2k tokens…
百度面试题
更新 2026-08-05
如何通过 vLLM 部署实现 2k tokens/s 的吞吐量?
百度
人工智能
专业服务
性能优化
风险判断
系统设计
vLLM
考察说明
考察对 vLLM 高性能推理架构和吞吐优化的理解
回答思路
说明 vLLM 的 PagedAttention 与连续批处理机制
讨论模型量化、并行策略和硬件配置对吞吐的影响
提出具体的监控调优手段验证吞吐目标
换一题
上一题
线上问题排查时,如果日志无法直接定位原因,你会如何进一步处理?
下一题
为什么数据库索引常用B+树而不是其他数据结构?请比较B+树与二叉树、哈希表、跳表等结构的适用场景。
本题还出现在
专业服务行业面试题
人工智能面试题