滴滴面试题 · Transformer

滴滴相关面试题,按最终去重题目聚合。

2131 道真题 · 当前筛选命中 27 · 更新 2026-08-05

筛选题目已选:Transformer
第 1 题Self-Attention和Cross-Attention分别介绍有什么异同,Transformer的encoder和decoder都用了什么? 考察对Transformer注意力机制原理及编码器解码器架构细节的理解技术原理方案权衡Transformer第 2 题多头注意力机制的计算复杂度是多少? 考察对Transformer中多头注意力计算复杂度的理解技术原理Transformer第 3 题Transformer 中 LayerNorm 放在 Attention 前还是后?有什么区别? 考察对 Transformer 架构细节的理解及两种归一化位置的设计差异技术原理方案权衡Transformer第 4 题请解释Transformer中注意力机制的计算复杂度,并说明为何它是O(n^2),其中n为序列长度。 考察对Transformer注意力机制及其计算复杂度的理解性能优化技术原理Transformer第 5 题请详细介绍一下Transformer的整体结构及其核心组件的作用。 考察对Transformer架构各组成部分的理解及其设计动机技术原理技术选型Transformer第 6 题请结合具体公式,分析 Transformer 中自注意力机制的计算过程及其在大模型中的关键作用。 考察对 Transformer 注意力机制公式的掌握及大模型原理的落地理解问题拆解技术原理Transformer第 7 题介绍一下你了解的位置编码,以及各自的优缺点。 考察对Transformer位置编码方案的原理理解与权衡分析技术原理方案权衡Transformer第 8 题单头注意力在 Transformer 中有什么局限性? 考察单头注意力的表达瓶颈与多头优势的对比技术原理方案权衡Transformer第 9 题Transformer 模型是如何处理时序信息的? 考察对 Transformer 位置编码和自注意力机制在时序建模中作用的理解问题拆解技术原理Transformer第 10 题为什么图像要划分patch,其对应的物理含义是什么?请与NLP中的文本序列处理进行对比联系。 考察对Vision Transformer中patch划分原理的理解及其与NLP序列建模的关联技术原理方案权衡Transformer第 11 题Transformer 用 BN 了吗? 考察对 Transformer 结构与 BatchNorm/LayerNorm 区别的理解技术原理方案权衡Transformer第 12 题介绍Attention、Self-Attention和Cross-Attention的区别 考察对注意力机制基本概念及其在不同场景下应用的理解技术原理Transformer第 13 题请说明在 Transformer 训练中,Q、K、V 矩阵计算如何做并行化,并写出伪代码。 考察对 Transformer 注意力机制并行计算原理的理解与表达能力编码实现技术原理Transformer第 14 题请说明 Self-Attention 的原理。 考察对 Transformer 核心机制 Self-Attention 的理解程度技术原理Transformer第 15 题请解释自注意力(self-attention)与目标注意力(target-attention)的区别。 考察对注意力机制变体及其应用场景的理解技术原理技术选型Transformer第 16 题请解释Transformer的结构和DPO的原理。 考察对核心模型架构和训练方法的理解深度技术原理技术选型Transformer第 17 题Transformer中为什么使用Layer Normalization而不是Batch Normalization? 考察对Transformer中归一化机制选择的理解及深层原因技术原理方案权衡Transformer第 18 题Transformer架构中FFN层的作用是什么? 考察对Transformer中前馈网络功能的理解技术原理Transformer第 19 题Transformer 中为什么要使用多头注意力机制? 考察多头注意力的设计动机与理论优势技术原理方案权衡Transformer第 20 题请解释Transformer编码器和解码器的工作原理。 考察对Transformer模型核心架构、自注意力机制和训练/推理流程的理解系统设计技术原理Transformer