人工智能面试题 · 问题拆解 · Transformer
人工智能相关岗位面试题。
共 11389 道真题 · 当前筛选命中 180 道 · 更新 2026-08-05
筛选题目已选:问题拆解 · Transformer
考察点
技术栈
第 81 题请说明自注意力机制中权重矩阵的参数量如何计算,并解释各矩阵的维度。 考察对自注意力机制中参数结构的理解与计算能力第 82 题请描述一个 prompt 从输入到输出完整经过 Transformer 的处理流程。 考察对 Transformer 架构从输入嵌入到输出生成的端到端理解第 83 题详细讲讲 Transformer,Self-Attention 中 QKV 的数学公式,以及你如何理解 QKV。 考察对 Transformer 核心架构和自注意力机制数学原理的理解深度第 84 题Transformer 模型是如何处理时序信息的? 考察对 Transformer 位置编码和自注意力机制在时序建模中作用的理解第 85 题请解释Transformer架构的核心组成部分和它的工作原理。 考察对Transformer模型结构和关键机制的理解第 86 题请说明 Transformer 中编码器与解码器的注意力机制有何区别,并解释在缩放点积注意力中除以√dk 的原因。 考察对 Transformer 注意力机制的理解深度,包括结构差异与数学原理第 87 题介绍Transformer结构,并说明各个部分的重要性。 考察对Transformer核心组件及其作用的理解深度第 88 题讲一下Transformer的计算复杂度? 考察对Transformer计算复杂度的理解及其与序列长度的关系第 89 题请解释Attention机制的计算公式,并分析其时间复杂度。 考察对Transformer核心注意力机制公式的理解及计算复杂度分析能力第 90 题请手写并讲解 Transformer Encoder 的核心实现,包括多头注意力、前馈网络、残差连接与层归一化。 考察对 Transformer Encoder 结构、注意力计算细节及实现的掌握程度第 91 题请解释多头注意力机制的原理和机制。 考察对多头注意力机制核心原理和实现机制的理解第 92 题请比较GPT和BERT的模型结构,并说明它们的预训练任务有何不同? 考察对GPT与BERT模型架构及预训练范式的理解第 93 题请介绍一下Vision Transformer(ViT)的基本原理和结构。 考察对ViT架构构成和整体流程的理解第 94 题Attention为什么要除以根号dk? 考察对Transformer中缩放点积注意力机制原理的理解第 95 题自注意力计算中为何除以 √dk? 考察自注意力机制中缩放因子的数学原理与稳定训练意识第 96 题请分析 Transformer 模型的计算复杂度,并给出其核心机制(如自注意力)的伪代码。 考察对 Transformer 架构计算复杂度的理解和伪代码表达能力第 97 题请详细讲解多头注意力机制,以及 Q/K/V 是如何计算的? 考察对 Transformer 多头注意力机制原理与计算流程的理解第 98 题解码器的输出形状是什么,如何做自回归过程? 考察对自回归生成流程和存储结构的理解第 99 题你对Transformer注意力机制的复杂度有怎样的理解?如果将其应用到大规模训练中,训练时间会受到哪些因素的影响? 考察对注意力机制时间与空间复杂度的理解,以及对训练时间影响因素的分析能力第 100 题为什么大语言模型(如GPT)擅长文本处理与生成? 考察对Transformer架构、预训练与自回归生成机制的理解