阿里巴巴面试题 · Transformer
阿里巴巴相关面试题,按最终去重题目聚合。
共 2826 道真题 · 当前筛选命中 49 道 · 更新 2026-08-05
筛选题目已选:Transformer
考察点
技术栈
第 1 题请介绍 Transformer 的底层结构,并说明各主要模块的作用。 考察对 Transformer 整体架构及核心组件的理解第 2 题Multi-Head Attention 现在有一些优化,现在主流的优化都有哪些方向,每个方向下有什么优化方法? 考察对注意力机制优化的体系化理解与前沿认知第 3 题在 ResNet 或 Transformer 中,残差连接的作用是什么?请展开说明。 考察对残差连接原理、作用及在典型架构中应用的理解深度第 4 题描述一下典型的encoder-only如Bert的结构细节 考察Transformer编码器架构及BERT模型的结构理解第 5 题介绍一下大语言模型中的注意力机制,多头相比单头注意力有何优势? 考察对注意力机制原理的理解及多头设计价值的掌握第 6 题请实现多头自注意力机制。 考察对Transformer核心组件的理解与编码实现能力第 7 题encoder-only和decoder-only的对比,纯理解场景哪更优? 考察对Transformer架构差异及其在理解任务上的适用性第 8 题什么是大语言模型的“上下文窗口”?扩展上下文窗口对模型性能有何影响? 考察对大语言模型上下文窗口概念的理解及其扩展带来的性能权衡第 9 题请介绍Transformer模型中的注意力掩码类型及其计算流程,特别说明padding mask和causal mask的区别。 考察对Transformer注意力机制中掩码原理和整体计算逻辑的理解第 10 题请推导多头注意力中矩阵计算的维度变化,并说明其与单头注意力的计算量关系。 考察对注意力机制矩阵运算维度的精确推导能力第 11 题请介绍Vision Transformer(ViT)的基本原理和主要流程。 考察对ViT模型结构与核心机制的理解第 12 题旋转位置编码相比于传统正余弦位置编码的主要区别是什么? 考察对两类位置编码机制差异的理解第 13 题请介绍Softmax函数的作用及其在Transformer中的应用。 考察对Softmax函数数学含义及其在注意力机制中作用的掌握第 14 题为什么注意力机制要除以根号 d_k?如果不缩放会怎样? 考察对注意力分数缩放动机与数值稳定性的理解第 15 题Transformer的训练复杂度较高,尤其在处理长序列时。你了解哪些工作是致力于降低其训练时间复杂度的? 考察对Transformer训练加速方法的了解深度与前沿追踪能力第 16 题请解释自回归语言模型如何生成下一个字。 考察对自回归生成过程的理解第 17 题请介绍 HSTU 架构,并说明其核心设计思想和适用场景。 考察对 HSTU 架构的理解、关键技术特点及其适用场景的把握第 18 题你如何理解大模型具备强大语义理解能力的原因? 考察对大模型技术原理的底层理解与表达能力第 19 题解释KV Cache的内存瓶颈,并推导多头注意力机制的计算复杂度。 考察对Transformer推理阶段KV Cache内存占用及注意力计算复杂度的理解第 20 题如何为多头注意力模块添加正则化或增强策略以提升训练稳定性? 考察模型训练的工程优化与设计能力