人工智能面试题 · 问题拆解 · Transformer
人工智能相关岗位面试题。
共 11389 道真题 · 当前筛选命中 180 道 · 更新 2026-08-05
筛选题目已选:问题拆解 · Transformer
考察点
技术栈
第 101 题请计算给定Transformer模型在一次前向推理中的FLOPs和内存开销。 考察对模型计算复杂度和显存占用的量化分析能力第 102 题请介绍Transformer中常见的几种位置编码方式,并说明各自的优缺点。 考察对Transformer位置编码原理及演进的理解第 103 题介绍Attention的计算,Self-Attention和Cross-Attention区别。 考察注意力机制的计算过程与两种注意力变体的理解第 104 题请详细介绍 Transformer 中的注意力机制(Attention Mechanism),并说明其如何工作。 深入理解注意力机制的原理、计算流程及在 Transformer 中的作用第 105 题Transformer中LayerNorm放在哪个位置?请说明其计算方式。 考察对Transformer结构细节和LayerNorm计算的掌握程度第 106 题手写自注意力机制,并说明Q、K、V的线性变换矩阵能否共享权重? 考察自注意力机制的编码实现与对QKV投影空间的理解第 107 题请介绍Transformer中的Attention机制,并解释为什么在计算中要除以sqrt(dk)。 考察对Transformer核心机制的原理理解与设计动机第 108 题介绍Multi-Head Attention,为什么要用多头的注意力机制? 考察对Transformer核心组件原理及设计动机的理解第 109 题请解释 Transformer 中的自注意力机制,并说明其计算流程与优势。 考察对自注意力机制原理、计算细节和优势的理解第 110 题讲解Transformer的Encoder结构 考察对Transformer编码器组件、计算流程与设计动机的理解第 111 题目前主流大模型的Transformer Block内的结构讲一下,哪些是可学习参数? 考察对Transformer Block结构组成及可学习参数的掌握第 112 题请谈谈Transformer是如何实现并行化计算的。在计算注意力得分时,为什么通常要对点积结果进行缩放(即除以根号dk)? 考察Transformer并行计算原理及注意力机制中缩放因子的数学动机第 113 题在Transformer模型中,哪个部分通常最占用显存(GPU内存)? 考察对Transformer各组件显存开销来源的理解第 114 题请解释BERT模型的原理。 考察对BERT架构、预训练任务及模型应用的理解程度第 115 题为什么需要KV Cache?为什么它提出时没有引起广泛关注,而后来才火起来? 考察对Transformer推理机制的理解、技术创新与工程需求的时间匹配关系第 116 题请介绍Transformer的核心结构,包括自注意力机制、多头注意力的作用以及位置编码的必要性。 考察对Transformer基础组件及其设计动机的理解第 117 题请介绍DETR目标检测模型的核心原理,说明其与经典两阶段或单阶段检测器的主要区别及优劣。 考察对DETR基于Transformer的端到端目标检测范式的理解第 118 题请谈谈你对Transformer模型结构的理解。 考察对Transformer核心组件、原理及特点的理解深度第 119 题请介绍 Attention 机制的数学原理、直观理解以及计算过程。 考察对 Attention 机制的理论理解与表达能力第 120 题Bert 的参数量是怎么决定的? 考察对 BERT 模型架构与参数量构成的理解