互联网/IT行业面试题 · Transformer
互联网/IT行业相关面试题,按题目行业基础数据聚合。
共 47588 道真题 · 当前筛选命中 348 道 · 更新 2026-08-05
筛选题目已选:Transformer
考察点
技术栈
第 241 题在Transformer中,如何降低注意力机制的计算复杂度? 考察对注意力机制复杂度问题的理解及优化方案第 242 题LLM中常用的激活函数有哪些? 考察对主流大语言模型架构中激活函数选型的理解第 243 题为什么现在 Decoder-only 成为大模型的主流架构? 考察对 Transformer 架构变体演进及大模型训练/推理权衡的理解第 244 题推导并计算多头注意力机制的时间与空间复杂度 考察对Transformer注意力机制计算复杂度的理解与推导能力第 245 题请写出自注意力机制的公式,并解释各符号含义。 考察对Transformer自注意力机制原理和公式的理解第 246 题请讲讲 Transformer 中的自注意力机制是如何工作的? 考察对自注意力机制原理、计算流程和关键组成部分的理解第 247 题请实现一个多头自注意力机制(Multi-Head Self-Attention)。 考察对Transformer核心组件的理解及编码实现能力第 248 题为什么要有position embedding? 考察对位置编码在序列模型中的作用与必要性的理解第 249 题LLaMA和GLM在模型架构等方面有哪些主要区别? 考察对主流开源大模型架构差异的理解和对比分析能力第 250 题请详细解释Transformer解码器(Decoder)的结构和工作原理,包括与编码器的区别、关键组件及其作用。 考察对Transformer解码器组件细节的理解,包括自注意力、交叉注意力和前馈网络第 251 题请介绍BERT的模型结构及其核心组件。 考察对BERT架构的理解,包括Transformer层、注意力机制和预训练任务第 252 题请介绍Transformer的整体架构及其关键组件的作用。 考察对Transformer架构核心组件及原理的理解第 253 题如何理解多模态技术,并结合实际场景说明它的应用与挑战? 考察对多模态概念的理解深度、实际应用认知和工程挑战识别第 254 题讲讲位置编码,为什么需要位置编码? 考察对Transformer等自注意力模型中位置信息作用的理解第 255 题Transformer 中 Padding 的策略是什么? 考察对 Transformer 输入处理中 Padding 机制的理解第 256 题Transformer中embedding怎么做的? 考察对Transformer输入表示机制的理解第 257 题请解释 Transformer 编码器和解码器在注意力机制上的区别。 考察对 Transformer 结构差异的理解第 258 题在Transformer的encoder中,感受野理论上覆盖所有token。你认为感受野越大越好还是越小越好?请说明你的判断依据和潜在权衡。 考察对Transformer全局注意力机制原理、性能与计算开销权衡的理解第 259 题为什么目前主流的大模型采用 Decoder-only 架构? 考察对 Transformer 架构演进、训练目标与能力差异的理解第 260 题请说明Transformer从最初版本到主流变体(如BERT、GPT)的主要演变过程。 考察对Transformer演进脉络及设计动因的理解