阿里巴巴面试题 · 方案权衡 · Transformer
阿里巴巴相关面试题,按最终去重题目聚合。
共 2826 道真题 · 当前筛选命中 17 道 · 更新 2026-08-05
筛选题目已选:方案权衡 · Transformer
考察点
技术栈
第 1 题encoder-only和decoder-only的对比,纯理解场景哪更优? 考察对Transformer架构差异及其在理解任务上的适用性第 2 题什么是大语言模型的“上下文窗口”?扩展上下文窗口对模型性能有何影响? 考察对大语言模型上下文窗口概念的理解及其扩展带来的性能权衡第 3 题请介绍Vision Transformer(ViT)的基本原理和主要流程。 考察对ViT模型结构与核心机制的理解第 4 题旋转位置编码相比于传统正余弦位置编码的主要区别是什么? 考察对两类位置编码机制差异的理解第 5 题Transformer的训练复杂度较高,尤其在处理长序列时。你了解哪些工作是致力于降低其训练时间复杂度的? 考察对Transformer训练加速方法的了解深度与前沿追踪能力第 6 题请介绍 HSTU 架构,并说明其核心设计思想和适用场景。 考察对 HSTU 架构的理解、关键技术特点及其适用场景的把握第 7 题大语言模型的长文本处理能力有限,目前有哪些技术可以缓解这一问题? 考察对长上下文处理技术的了解、原理理解及权衡意识第 8 题如何降低 KV cache 的内存占用? 考察对 Transformer 推理中 KV cache 优化技术的理解第 9 题如何看待目前大语言模型都是decoder-only结构? 考察对大语言模型架构演进的原理性理解与权衡分析第 10 题为什么大模型会选择使用旋转位置编码? 考察对旋转位置编码设计动机和实际优势的综合理解第 11 题在 Transformer 中使用位置编码(PE)相比不使用时有哪些优势? 考察对 Transformer 位置信息建模必要性与 PE 优势的理解第 12 题Transformer 中通常使用哪种归一化方式?为什么选择 Layer Normalization 而非 Batch Normalization? 考察对 Transformer 中归一化技术选型及其理论依据的理解第 13 题encoder-only、decoder-only、encoder-decoder 不同架构在实际应用的使用场景分别是什么? 考察对三种主流 Transformer 架构特点及适用场景的理解第 14 题请解释Grouped-Query Attention(GQA)的原理及其实现方式。 考察对GQA机制原理和高效实现的理解第 15 题在多头注意力中,存在哪些常见的变体?如何设计新的变体? 考察对注意力机制变体的了解与设计思考第 16 题Transformer 中为什么需要前馈神经网络(FFN)? 考察对 FFN 非线性变换作用的理解第 17 题请介绍你的项目或研究中是否使用过 Transformer 相关的目标检测或行人分析技术,具体是怎么应用的? 考察对 Transformer 在视觉任务中应用的理解及项目结合能力