互联网/IT行业面试题 · Transformer
互联网/IT行业相关面试题,按题目行业基础数据聚合。
共 47588 道真题 · 当前筛选命中 348 道 · 更新 2026-08-05
筛选题目已选:Transformer
考察点
技术栈
第 101 题请简要介绍Transformer的基本结构,并说明它相比传统RNN的优势。 考察对Transformer架构和序列建模演进的理解第 102 题请介绍Transformer模型中的主要计算过程,包括自注意力机制和前馈网络的计算步骤。 考察对Transformer核心计算流程的理解,包括自注意力的矩阵运算、多头机制及前馈网络第 103 题请解释BERT模型的原理。 考察对BERT架构、预训练任务及模型应用的理解程度第 104 题为什么Transformer中的位置编码常采用三角函数形式? 考察对Transformer位置编码设计动机与技术细节的理解第 105 题Transformer中Attention的计算公式是什么? 考察注意力机制的基础计算流程第 106 题讲讲transformers架构 考察对Transformer核心机制的理解与讲解能力第 107 题请解释BERT模型的核心工作机制,并说明它相较于传统深度学习模型的主要优势。 考察对预训练语言模型原理的理解及与传统模型的对比能力第 108 题目前大模型架构有哪些? 考察对大模型主流架构类型的掌握与分类能力第 109 题CNN、Transformer的区别,分别更适合怎样的任务? 考察对两种主流深度学习架构原理差异与适用场景的理解第 110 题为什么 Transformer 的注意力分数要除以根号 dk? 考察注意力机制数学设计的直觉与稳定性理解第 111 题介绍Transformer,编码器和解码器的注意力有什么区别? 考察对Transformer架构中自注意力与交叉注意力的理解第 112 题在典型Transformer模型中,Attention模块和MLP模块的参数规模通常哪个更大?请说明原因。 考察对Transformer结构参数分布的准确理解第 113 题用BERT做分类时,softmax应该添加在哪个层级,维度如何选择? 考察BERT分类头的实现细节与输出维度设计第 114 题Transformer的注意力为什么要多个头,多个头为什么能注意到不同信息,为什么一个头不能呢,反正最终输出都是相同维度,难道一起就学不到分开的东西吗 考察多头注意力机制的设计动机与信息多样性第 115 题请解释Transformer中的自注意力机制是如何计算的,以及它的作用是什么? 考察对自注意力机制原理及作用的理解第 116 题请介绍你对 Transformer 模型的了解。 考察对 Transformer 架构核心组件和原理的理解深度第 117 题请计算给定Transformer模型在一次前向推理中的FLOPs和内存开销。 考察对模型计算复杂度和显存占用的量化分析能力第 118 题请详细讲解Transformer的整体结构及其各组成部分的作用。 考察对Transformer架构的理解深度与关键组件原理第 119 题代码题:实现 Casual mask 的 MHA,并说明其计算复杂度。 考察注意力机制实现细节、因果掩码原理与复杂度分析第 120 题为什么 KV Cache 能极大地提升推理速度? 考察对计算复杂度和推理性能优化原理的理解