滴滴面试题 · 方案权衡 · Transformer
滴滴相关面试题,按最终去重题目聚合。
共 2131 道真题 · 当前筛选命中 13 道 · 更新 2026-08-05
筛选题目已选:方案权衡 · Transformer
考察点
技术栈
第 1 题Self-Attention和Cross-Attention分别介绍有什么异同,Transformer的encoder和decoder都用了什么? 考察对Transformer注意力机制原理及编码器解码器架构细节的理解第 2 题Transformer 中 LayerNorm 放在 Attention 前还是后?有什么区别? 考察对 Transformer 架构细节的理解及两种归一化位置的设计差异第 3 题介绍一下你了解的位置编码,以及各自的优缺点。 考察对Transformer位置编码方案的原理理解与权衡分析第 4 题单头注意力在 Transformer 中有什么局限性? 考察单头注意力的表达瓶颈与多头优势的对比第 5 题为什么图像要划分patch,其对应的物理含义是什么?请与NLP中的文本序列处理进行对比联系。 考察对Vision Transformer中patch划分原理的理解及其与NLP序列建模的关联第 6 题Transformer 用 BN 了吗? 考察对 Transformer 结构与 BatchNorm/LayerNorm 区别的理解第 7 题Transformer中为什么使用Layer Normalization而不是Batch Normalization? 考察对Transformer中归一化机制选择的理解及深层原因第 8 题Transformer 中为什么要使用多头注意力机制? 考察多头注意力的设计动机与理论优势第 9 题为什么Transformer中的FFN层通常采用先升维再降维的结构? 考察对FFN层维度设计原理的掌握第 10 题请介绍几种常见的 Attention 加速方式及其原理。 考察对 Transformer 注意力机制的计算效率和优化方法的理解第 11 题注意力机制的类型(MHA,MQA,GQA,MLA)各自的优缺点 考察对注意力机制变体的原理理解与权衡分析能力第 12 题Transformer 中为何使用 LayerNorm 而非 BatchNorm?这对大模型训练的稳定性有何影响? 考察对归一化机制差异及其对训练稳定性的影响的理解第 13 题为什么用 Transformer 建模用户行为序列,而不是 LSTM? 考察对序列建模方法差异的理解及技术选型能力