人工智能面试题 · 性能优化
人工智能相关岗位面试题。
共 11389 道真题 · 当前筛选命中 605 道 · 更新 2026-08-05
筛选题目已选:性能优化
考察点
技术栈
第 21 题请解释GQA(Grouped Query Attention)的原理,并说明它与MHA和MQA的区别及各自的优缺点。 考察对GQA机制的理解、对比分析能力及模型推理优化意识第 22 题不同设备模块比如交换机、服务器,它们的字段特征都不一样,那你怎么做统一化训练? 考察面对异构数据时特征统一与模型训练方案的设计能力第 23 题请介绍一下你负责的项目中的数据切块(chunk)方案。 考察对数据切块原理、实践和权衡的理解第 24 题请介绍一次你参与模型推理部署的经历。 考察推理部署实践、关键环节理解和结果复盘能力第 25 题是否有成熟的评价体系衡量召回质量? 考察对召回评估指标与体系的理解及实际应用能力第 26 题如果你在 GPU 资源有限的条件下同时提供推理和微调服务,如何做资源分配和任务调度以保证时延和吞吐? 考察在有限GPU资源下平衡推理服务时延与训练吞吐的资源分配和调度设计能力第 27 题有哪些缓解大语言模型幻觉的工程方法? 考察针对幻觉问题的实际解决手段与权衡第 28 题请解释什么是动态批处理(Dynamic Batching)及它的工作原理。 考察对动态批处理概念、动机和实现机制的理解第 29 题请列举大语言模型评测中常用的基准数据集,并说明其特点。 考察对大语言模型主流基准数据集及适用范围的了解第 30 题请说明Python的内存管理机制和垃圾回收(GC)原理。 考察对Python内存管理、引用计数和分代回收的理解第 31 题模型增大主要带来的是什么瓶颈? 考察对大规模模型训练与推理资源瓶颈的理解第 32 题在C++项目中,你是如何设计传感器消息缓存以应对大量数据的? 考察大数据量下C++缓存设计、内存管理与性能优化能力第 33 题是否熟悉推理优化中的FlashAttention和KV-Cache? 考察对推理优化关键技术原理和实际应用的理解第 34 题在 Transformer 模型推理的 Attention 计算中,有哪些显存优化策略?请分别说明其思路和适用场景。 考察对大模型推理显存优化技术的理解深度与工程实践认知第 35 题给定大量边界框,如何高效并行计算所有两两框之间的IOU?请给出向量化或加速的思路。 考察算法优化、并行计算与向量化能力第 36 题视频抽帧通常怎么实现? 考察视频处理基础、关键帧选取策略与性能考量第 37 题在序列建模任务中,你会从哪些方面考虑效率优化?请结合具体技术手段说明。 考察对序列模型计算瓶颈的认识及工程优化能力第 38 题请介绍你在实习中如何实现推理加速? 考察实习中推理加速的实践方法与效果第 39 题你如何处理用户意图识别问题?如何评估和提升其准确率? 考察对NLP意图识别流程的理解、评估方法和优化策略第 40 题请分析模型推理在pipeline中的耗时,并说明优化方向。 考察对模型推理性能影响因素的理解和优化思路