互联网/IT行业面试题 · 方案权衡 · Transformer
互联网/IT行业相关面试题,按题目行业基础数据聚合。
共 47588 道真题 · 当前筛选命中 94 道 · 更新 2026-08-05
筛选题目已选:方案权衡 · Transformer
考察点
技术栈
第 21 题FFN(前馈神经网络)为什么要先升维再降维? 考察对Transformer中前馈网络结构设计的理解及直觉第 22 题Transformer 为什么使用 LayerNorm 而不是 BatchNorm? 考察对归一化机制在序列建模中适用性的理解第 23 题说说CNN和Transformer区别 考察对卷积神经网络与Transformer架构核心差异及其适用场景的理解第 24 题Transformer 中为什么要使用多头注意力机制? 考察多头注意力的设计动机与理论优势第 25 题Attention机制有哪些常见类型?位置编码有哪些常见方式? 考察对Transformer核心组件Attention机制和位置编码的分类与原理理解第 26 题请解释 Transformer 的核心原理,并说明它为什么能取代 RNN 成为主流模型。 考察对 Transformer 架构的深入理解及技术演进认知第 27 题请详细解释BERT模型的结构原理、主要缺点及其改进模型。 考察对BERT预训练模型原理的深入理解、局限性的把握以及相关改进工作的了解第 28 题在 Transformer 架构中,MOE(混合专家模型)一般加在哪些位置? 考察对 MOE 组件在 Transformer 中部署位置的理解第 29 题请介绍除 DIN 之外的序列建模方法,并对比 Transformer 与 DIN 在推荐场景中的区别。 考察序列建模技术积累与推荐场景下的模型选型能力第 30 题为什么Transformer中的位置编码常采用三角函数形式? 考察对Transformer位置编码设计动机与技术细节的理解第 31 题请解释BERT模型的核心工作机制,并说明它相较于传统深度学习模型的主要优势。 考察对预训练语言模型原理的理解及与传统模型的对比能力第 32 题CNN、Transformer的区别,分别更适合怎样的任务? 考察对两种主流深度学习架构原理差异与适用场景的理解第 33 题在Transformer框架下,CV、NLP、语音是否可能统一? 考察对Transformer跨模态统一潜力的理解和分析能力第 34 题在Transformer中,多头注意力机制相比单头注意力有哪些优势?头数增加会如何影响算法复杂度? 考察对多头注意力机制原理及其计算复杂度的理解第 35 题我们现在是两阶段推荐架构:第一阶段召回用的是 embedding 点积召回,第二阶段是 MLP 跟 transformer 做多目标打分。那你觉得在我们这么大规模的数据量下,如果要做 real-time re-ranking,你会在架构上怎么做 trade-off?怎么压低 latency? 考察推荐系统实时重排架构的延迟与效果权衡能力第 36 题你了解哪些 Transformer 的位置编码方式?它们分别有什么特点? 考察对位置编码常见方案及其设计动机的掌握第 37 题Transformer的位置编码中为什么将基底设为10000? 考察对Transformer位置编码设计原理和参数选择的理解第 38 题Transformer是encoder-decoder架构,而GPT是decoder-only架构,为什么会演变成这样一种形式?为什么把encoder给舍弃掉了? 考察对语言模型架构演进逻辑和decoder-only优势的理解第 39 题介绍Transformer的位置编码,为什么这么设计,为什么可以达到位置编码的效果,编码了相对位置还是绝对位置;介绍RoPE 考察位置编码原理、设计动机及RoPE的理解第 40 题Transformer 的位置编码是怎么做的?为什么需要它? 考察对位置信息建模原理及常见实现的理解