互联网/IT行业面试题 · 技术原理 · Transformer
互联网/IT行业相关面试题,按题目行业基础数据聚合。
共 47588 道真题 · 当前筛选命中 344 道 · 更新 2026-08-05
筛选题目已选:技术原理 · Transformer
考察点
技术栈
第 121 题你对大模型的结构、工作流有了解吗? 考察对大模型基础架构和核心工作流程的理解程度第 122 题请介绍你对Transformer模型的理解,并说明它是如何工作的。 考察对Transformer架构的掌握程度及知识深度第 123 题手写实现Transformer编码器中的多头注意力机制(MHA),并简要说明各步骤。 考察对Transformer编码器与多头注意力机制的理解及代码实现能力第 124 题请介绍Self-Attention机制的原理,以及它在大模型中的作用。 考察对注意力机制核心原理及其对模型能力贡献的理解第 125 题在Transformer框架下,CV、NLP、语音是否可能统一? 考察对Transformer跨模态统一潜力的理解和分析能力第 126 题在计算注意力分数时,为什么要除以根号 d_k? 考察对注意力缩放原因的理解第 127 题在Transformer中,多头注意力机制相比单头注意力有哪些优势?头数增加会如何影响算法复杂度? 考察对多头注意力机制原理及其计算复杂度的理解第 128 题Transformer 是怎么把文本转成 token 并用于模型输入的?请描述完整的处理流程。 考察文本分词、词典映射和输入构造的完整流程第 129 题请写出 Transformer 自注意力机制的计算公式,并简要解释每个符号的含义。 考察对 Transformer 自注意力机制的数学表达与符号理解第 130 题Attention为什么要除以根号dk? 考察对Transformer中缩放点积注意力机制原理的理解第 131 题请解释多头注意力机制(MHA)的基本原理和工作流程。 考察对Transformer核心组件多头注意力的理解第 132 题请介绍Transformer的整体结构,并说明其中关键组件的作用。 考察对Transformer架构及其核心机制的理解第 133 题dk是怎么确定的? 考察对模型维度与注意力头配置关系的理解第 134 题介绍Transformer架构 考察对Transformer核心组件、设计动机和整体工作原理的理解第 135 题Transformer的Attention计算过程中为什么要对QK的点积进行scale? 考察对Attention机制中数值稳定性和Softmax梯度的理解第 136 题你了解哪些 Transformer 的位置编码方式?它们分别有什么特点? 考察对位置编码常见方案及其设计动机的掌握第 137 题请介绍 Self-Attention 机制的原理。 考察对注意力机制核心概念、计算流程与作用的理解第 138 题请描述GPT类decoder-only模型的工作流程和整体架构。 考察对生成式大模型架构和推理流程的理解第 139 题请结合你在大模型方向的研究与实践,谈谈 Transformer 的架构特点,以及这些特点如何支撑大模型的训练和部署。 考察对 Transformer 架构及其在大模型工程应用中的理解深度第 140 题Transformer的位置编码中为什么将基底设为10000? 考察对Transformer位置编码设计原理和参数选择的理解