互联网/IT行业面试题 · 技术原理 · Transformer
互联网/IT行业相关面试题,按题目行业基础数据聚合。
共 47588 道真题 · 当前筛选命中 344 道 · 更新 2026-08-05
筛选题目已选:技术原理 · Transformer
考察点
技术栈
第 301 题请介绍Transformer模型中编码器(Encoder)和解码器(Decoder)的结构与各自作用,并说明它们之间的区别。 考察对Transformer核心组件结构与功能差异的理解第 302 题Encoder中的self-attention和Decoder中的self-attention有什么区别? 考察对Transformer编码器与解码器注意力机制差异的理解第 303 题在 DIN(Deep Interest Network)中,Attention 的计算方式与标准 Transformer 的 Attention 有何不同? 考察对 DIN 中局部激活单元(Attention 机制)的理解及其与 Transformer Attention 的对比第 304 题计算Attention的softmax之前为什么要除根号dk? 考察对Transformer中注意力机制缩放因子原理的理解第 305 题请详细介绍Transformer模型的结构和工作原理。 考察对Transformer模型架构、核心机制及工作原理的理解第 306 题请解释多头注意力机制(MHA)的运行机制。 考察对Transformer核心组件多头注意力机制原理和结构的理解第 307 题RoPE 旋转位置编码的核心思想是什么? 考察对 RoPE 设计原理、数学形式及优点的深入理解第 308 题请比较正余弦位置编码(如Transformer原始实现)与RoPE(旋转位置编码)的异同,并说明RoPE相对于正余弦编码的优势。 考察对位置编码原理及其演进的理解,特别是RoPE的设计动机与优势第 309 题请解释Transformer模型的核心组成部分及其各自的作用。 考察对Transformer架构的理解深度和关键机制掌握第 310 题从技术原理和实际应用角度看,Mamba 未来是否有取代 Transformer 的可能?请结合两者核心机制说明你的判断。 考察对两种模型架构差异的理解及技术趋势判断能力第 311 题有去了解过大语言模型原理吗? 考察对大型语言模型基础原理的主动学习与理解深度第 312 题请阐述Transformer的原理以及和其他注意力机制的区别 考察对Transformer架构核心机制及其演进脉络的理解程度第 313 题在 Transformer 的缩放点积注意力中,为什么 Q 和 K 的点积要除以根号下 d_k,能不能用其他数值?请从数学原理上解释。 考察对注意力机制数学原理的理解,特别是方差分析与缩放因子的作用第 314 题请谈谈Transformer是如何实现并行化计算的。在计算注意力得分时,为什么通常要对点积结果进行缩放(即除以根号dk)? 考察Transformer并行计算原理及注意力机制中缩放因子的数学动机第 315 题请说明 RoPE 旋转位置编码的核心思想。 考察对 RoPE 原理及相对位置建模的理解第 316 题Transformer注意力分数为何要做缩放(即为什么除以根号d)? 考察对注意力机制数学动机和数值稳定性的理解第 317 题Qwen2.5-VL 中的 Transformer 结构与普通 Transformer 结构有哪些不同? 考察对现代 LLM 架构演进及视觉语言模型适配机制的理解第 318 题说一下Attention是怎么做的,Encoder和Decoder的Attention一样吗? 考察对Attention机制原理及Encoder-Decoder中差异的理解第 319 题请介绍BERT模型的结构和核心原理。 考察对预训练模型架构与训练机制的理解深度第 320 题CLIP 中文本编码器的结构是什么样的,输入输出是什么? 考察对 CLIP 模型架构细节的理解以及多模态模型中文本分支的处理方式