互联网/IT行业面试题 · Transformer
互联网/IT行业相关面试题,按题目行业基础数据聚合。
共 47588 道真题 · 当前筛选命中 348 道 · 更新 2026-08-05
筛选题目已选:Transformer
考察点
技术栈
第 161 题请具体说明在Transformer中如何实现多头注意力机制(Multi-Head Attention)。 考察对注意力机制实现细节的理解,包括Q/K/V投影、缩放点积和拼接输出第 162 题请解释 Transformer 中 Self-Attention 和 Target Attention 的区别。 考察对注意力机制的理解以及两种注意力在不同场景下的应用第 163 题请介绍你了解的生成式模型,并重点介绍 GLM 系列模型的整体结构。 考察对生成式模型的基本认知及对 GLM 模型结构的理解第 164 题请比较 LSTM 与 Transformer 在序列建模上的主要差异。 考察对两种主流序列模型在结构、并行性与长程依赖上的对比理解第 165 题请分析Transformer前向推理时Attention模块的计算量与时间复杂度。 考察对Transformer中自注意力计算复杂度与推理阶段计算特性的理解第 166 题请描述一个Transformer模型从输入到输出的完整处理流程。 考察对Transformer架构整体流程和关键组件的理解第 167 题请介绍 Transformer 的核心架构,并说明它相比传统序列模型的主要优势。 考察对 Transformer 整体架构和核心优势的理解第 168 题请介绍DIN的注意力池化机制,并说明它与Transformer的self-attention有什么区别。 考察对DIN注意力机制的理解及与Transformer的对比第 169 题Transformer和RNN在对话任务中的本质区别?为什么现在大模型都用Transformer? 考察对序列建模核心机制的理解及架构选型原因第 170 题RoPE 旋转位置编码是如何运作的?为什么它适合长文本? 考察对 RoPE 数学原理及其长文本外推优势的理解第 171 题讲下Transformer结构 考察对Transformer整体架构与核心组件的理解第 172 题请介绍Transformer中多头注意力机制(MHA)的工作原理及其作用。 考察对Transformer核心组件多头注意力机制的理解深度第 173 题Transformer 相比传统 RNN/LSTM 有哪些优势? 考察对 Transformer 架构核心特性的理解与对比能力第 174 题请介绍几种常见的稀疏注意力变体,并说明其核心思想与适用场景。 考察对主流稀疏注意力机制的系统性了解与选型判断第 175 题手写自注意力机制,并说明Q、K、V的线性变换矩阵能否共享权重? 考察自注意力机制的编码实现与对QKV投影空间的理解第 176 题请介绍Attention机制,并说明在Transformer中Attention的类型。 考察对Attention机制本质和常见类型的理解第 177 题详细描述,如果给一个txt存储的文本,从预处理到SFT的训练流程,要包括对数据的预处理、tokenize、forward、loss计算、参数更新,越细越好。 考察大模型SFT全流程的技术细节与工程实现能力第 178 题请介绍大模型主流模型结构的主要演进变化 考察对大模型架构演进、关键技术变革的理解第 179 题请介绍Transformer Decoder中的cross-attention机制,包括它的作用、计算流程以及与self-attention的区别。 考察对Transformer架构中cross-attention机制的理解与表达能力第 180 题解码器的输出形状是什么,如何做自回归过程? 考察对自回归生成流程和存储结构的理解