互联网/IT行业面试题 · 问题拆解 · Transformer
互联网/IT行业相关面试题,按题目行业基础数据聚合。
共 47588 道真题 · 当前筛选命中 77 道 · 更新 2026-08-05
筛选题目已选:问题拆解 · Transformer
考察点
技术栈
第 1 题请介绍 Self-Attention 的机制,并分析其时间复杂度。 考察 Transformer 核心机制的理解与复杂度分析能力第 2 题请介绍Transformer的整体结构,包括其主要模块与各自的作用。 考察对Transformer架构的全面理解与组件职责的掌握第 3 题请描述 Qwen2 的模型架构,包括其主要组件和设计特点。 考察对大语言模型基础架构的理解,特别是 Qwen2 的具体设计第 4 题多头注意力机制与单头注意力机制相比,在计算量和参数量上有什么变化? 考察对多头注意力机制计算复杂度和参数规模的理解第 5 题请介绍 Transformer 模型的核心结构,并说明自注意力机制的作用及其计算过程。 考察对 Transformer 架构和自注意力机制的理解深度第 6 题如果Transformer的注意力机制中把K去掉,变成QQV,会有什么问题? 考察对注意力机制中键(K)作用的理解,以及去掉K后带来的影响第 7 题目前主流大模型的Transformer Block内的结构讲一下,哪些是可学习参数? 考察对Transformer Block结构组成及可学习参数的掌握第 8 题为什么Transformer的注意力计算要除以根号dk? 考察对注意力缩放原因的理解及数值稳定性知识第 9 题请手写实现Transformer Decoder层,并说明如何实现mask机制以支持自回归生成。 考察对Transformer Decoder结构、自注意力mask和因果掩码的实现能力第 10 题假设让你用 BERT 或 Transformer 搭建一个文本分类模型,你会如何快速完成?请描述从准备到训练的关键步骤。 考察对预训练模型微调的流程熟悉度及工程实践能力第 11 题Transformer 中 Encoder 与 Decoder 的自注意力机制有何区别? 考察对 Transformer 注意力机制结构差异及训练阶段行为的理解第 12 题Mask Attention是怎么做的? 考察对Transformer中Masked Attention机制的理解,包括实现原理和不同应用场景第 13 题请说明 Transformer 中编码器与解码器的注意力机制有何区别,并解释在缩放点积注意力中除以√dk 的原因。 考察对 Transformer 注意力机制的理解深度,包括结构差异与数学原理第 14 题在Transformer的训练和推理过程中,如何处理输入序列中的padding?请说明mask的作用及实现方式。 考察对Transformer中padding处理和注意力掩码机制的理解第 15 题请手写实现一个 Transformer Encoder 的核心结构。 考察对 Transformer Encoder 的结构理解与代码实现能力第 16 题请解释Self-Attention机制的原理及其在Transformer中的作用。 考察对注意力机制核心思想与计算流程的理解第 17 题请描述一个 prompt 从输入到输出完整经过 Transformer 的处理流程。 考察对 Transformer 架构从输入嵌入到输出生成的端到端理解第 18 题Transformer的全局依赖是怎么做的 考察Transformer自注意力机制对全局依赖的建模原理第 19 题请详细说明Transformer模型的核心结构组成及其各组件的作用。 考察对Transformer架构的深入理解与模块间关系的把握第 20 题请说明Transformer的整体模型结构及其关键组件。 考察对Transformer架构核心组成与设计原理的理解