互联网/IT行业面试题 · 问题拆解 · Transformer

互联网/IT行业相关面试题,按题目行业基础数据聚合。

47588 道真题 · 当前筛选命中 77 · 更新 2026-08-05

筛选题目已选:问题拆解 · Transformer
第 61 题请解释 Transformer 中的自注意力机制,并说明其计算流程与优势。 考察对自注意力机制原理、计算细节和优势的理解问题拆解技术原理Transformer第 62 题大模型是怎么理解人类语言的意图的? 考察对大规模语言模型意图理解机制的理解深度问题拆解技术原理Transformer第 63 题请介绍 Transformer 的基本结构和核心机制,并说明它如何解决长距离依赖问题。 考察对 Transformer 核心组件和作用机制的理解问题拆解技术原理Transformer第 64 题详细介绍一下Transformer的结构? 考察对Transformer核心组件、设计原理和整体架构的理解问题拆解技术原理Transformer第 65 题请介绍 Transformer 的核心架构组成,并说明自注意力机制的原理。 考察对 Transformer 架构的理解深度与关键机制掌握问题拆解技术原理Transformer第 66 题Transformer中的Q、K、V分别来自哪里?各自代表什么含义? 考察对Transformer自注意力机制中查询、键、值向量来源与作用的原理理解问题拆解技术原理Transformer第 67 题请分析 Decoder-only 文本模型的结构特点,并说明其参数量主要由哪些部分组成。 考察对 Decoder-only 架构的理解及参数量估算能力问题拆解技术原理Transformer第 68 题计算Attention的softmax之前为什么要除根号dk? 考察对Transformer中注意力机制缩放因子原理的理解问题拆解技术原理Transformer第 69 题请详细介绍Transformer模型的结构和工作原理。 考察对Transformer模型架构、核心机制及工作原理的理解问题拆解技术原理Transformer第 70 题请谈谈Transformer是如何实现并行化计算的。在计算注意力得分时,为什么通常要对点积结果进行缩放(即除以根号dk)? 考察Transformer并行计算原理及注意力机制中缩放因子的数学动机问题拆解技术原理Transformer第 71 题请介绍BERT模型的结构和核心原理。 考察对预训练模型架构与训练机制的理解深度问题拆解技术原理BERTTransformer第 72 题请在白板/代码中实现Transformer的Decoder Block(含Masked Self-Attention与Cross-Attention)。 考察对Transformer Decoder结构、子层顺序及掩码细节的掌握与编码能力编码实现问题拆解技术原理Transformer第 73 题介绍Attention的计算,Self-Attention和Cross-Attention区别。 考察注意力机制的计算过程与两种注意力变体的理解问题拆解技术原理Transformer第 74 题讲讲MHA、Attention公式,为什么需要除以根号 dk。 考察对Transformer核心组件及缩放点积注意力原理的掌握问题拆解技术原理Transformer第 75 题请详细说明Transformer中Attention机制的q、k、v分别代表什么,以及它们如何通过计算得到最终输出,其中Softmax起到什么作用? 考察对注意力机制核心原理、计算流程及Softmax作用的理解问题拆解技术原理Transformer第 76 题请详细讲解Transformer架构的整体工作流程,包括从输入到输出的主要步骤。 考察对Transformer整体流程的清晰理解与关键机制掌握问题拆解系统设计技术原理Transformer第 77 题请解释Transformer模型中的位置编码(Positional Encoding)的作用和实现方式,并说明它与嵌入(Embedding)的关系。 考察对Transformer位置编码机制的理解及其在序列建模中的作用问题拆解技术原理Transformer