人工智能行业面试题 · Transformer

人工智能行业相关面试题,按题目行业基础数据聚合。

共 6000 道真题 · 当前筛选命中 59 道 · 更新 2026-08-05

筛选题目已选:Transformer
第 41 题请讲解Transformer的总体结构及各组成部分的作用。 考察对Transformer核心架构的理解与表达能力沟通表达问题拆解技术原理Transformer第 42 题请阐述一个你最熟悉的视觉语言(VL)模型,包括其核心架构与典型应用场景。 考察对视觉语言模型架构理解、关键机制掌握及实际应用认知业务理解问题拆解技术原理Transformer第 43 题请介绍Transformer中的Block(编码器块)结构,并说明各组成部分的作用。 考察对Transformer核心组件及其设计意图的理解技术原理Transformer第 44 题请写出 Transformer 中所有矩阵转换的数学公式,并解释为什么需要除以根号 d。 考察注意力机制的数学原理与缩放理解编码实现技术原理Transformer第 45 题请介绍 Transformer 模型的结构,以及编码器和解码器各自的作用。 考察对 Transformer 架构及其各组件功能的理解技术原理技术选型Transformer第 46 题Transformer和CNN的区别和用法是什么? 考察对两类主流神经网络架构的原理差异、适用场景和各自优缺点的理解技术原理技术选型CNNTransformer第 47 题为什么现在主流都用Decoder-only而不是Encoder-decoder? 考察对主流大模型架构选型原因的理解,包括训练效率、推理效率和效果权衡技术原理技术选型方案权衡Transformer第 48 题有哪些Encoder-Decoder结构模型? 考察对序列到序列模型架构的掌握与分类能力技术原理Transformer第 49 题为什么在文本任务(如Transformer/BERT)中通常选择Layer Normalization(LN)而不是Batch Normalization(BN)? 考察对文本与图像数据特性差异对归一化选择影响的理解技术原理方案权衡BERTTransformer第 50 题请解释注意力机制中self-attention的计算复杂度,并说明其瓶颈。 考察对Transformer核心机制的计算复杂度理解及性能瓶颈识别技术原理技术选型Transformer第 51 题为什么主流大语言模型选择Decoder-only架构? 考察对Transformer架构差异及大模型训练目标的理解技术原理方案权衡Transformer第 52 题目前市面上常用的大模型是什么架构的? 考察对大模型主流架构、工作原理和发展脉络的理解技术原理技术选型Transformer第 53 题请编写一个多头注意力机制的代码实现。 考察对注意力机制原理的理解及编程实现能力编码实现技术原理PyTorchTransformer第 54 题请解释多头自注意力机制的原理,并分析其计算复杂度。 考察对Transformer核心机制的理解及复杂度分析能力性能优化技术原理Transformer第 55 题Llama2 的 transformer block 相比原始 transformer 做了哪些关键改变? 考察对 Llama2 架构中 RMSNorm、RoPE、SwiGLU、PreNorm 等核心组件的理解技术原理技术选型Transformer第 56 题请解释注意力机制的核心思想及常见实现方式。 考察对序列建模中依赖捕获与加权融合的理解问题拆解技术原理Transformer第 57 题请解释深度学习中 Batch Normalization 应用于激活函数之前(pre-Norm)与之后(post-Norm)的区别及各自适用场景。 考察对 Batch Normalization 位置设计差异的理解及实践权衡技术原理方案权衡Transformer第 58 题请写出 self-attention 的计算公式,并解释各部分的含义。 考察对 Transformer 核心 self-attention 机制的数学表达与理解技术原理Transformer第 59 题请手写Transformer模型的核心代码,并解释为什么注意力机制中要除以根号d。 考察Transformer架构的实现能力与注意力机制缩放因子的数学原理编码实现技术原理Transformer