人工智能面试题 · 方案权衡 · Transformer
人工智能相关岗位面试题。
共 11389 道真题 · 当前筛选命中 236 道 · 更新 2026-08-05
筛选题目已选:方案权衡 · Transformer
考察点
技术栈
第 221 题注意力机制的类型(MHA,MQA,GQA,MLA)各自的优缺点 考察对注意力机制变体的原理理解与权衡分析能力第 222 题请解释Grouped-Query Attention(GQA)的原理及其实现方式。 考察对GQA机制原理和高效实现的理解第 223 题Transformer 中为何使用 LayerNorm 而非 BatchNorm?这对大模型训练的稳定性有何影响? 考察对归一化机制差异及其对训练稳定性的影响的理解第 224 题多头和单头的区别在哪里? 考察对多头注意力机制与单头注意力机制的理解和对比能力第 225 题在多头注意力中,存在哪些常见的变体?如何设计新的变体? 考察对注意力机制变体的了解与设计思考第 226 题请解释 Self-Attention、Cross-Attention 和 GQA(Grouped Query Attention)在 Transformer 中的作用与区别。 考察对 Transformer 注意力机制变体及原理的理解第 227 题Transformer中Pre-Norm和Post-Norm的设计差异是什么?对模型训练稳定性和性能有何影响? 考察对Transformer归一化层位置差异及其对训练稳定性和性能影响的理解第 228 题像GPT和图像生成模型,大都是decoder-only架构,为什么? 考察对生成式模型架构选择的深层理解与权衡能力第 229 题BERT模型相较于Transformer架构的优化是什么? 考察对BERT核心创新及与Transformer基础架构差异的理解第 230 题Transformer 中为什么需要前馈神经网络(FFN)? 考察对 FFN 非线性变换作用的理解第 231 题为什么用 Transformer 建模用户行为序列,而不是 LSTM? 考察对序列建模方法差异的理解及技术选型能力第 232 题位置编码的类别介绍,及其在序列拓长场景下的应用 考察对位置编码原理、类别划分及长序列外推能力的理解第 233 题为什么Attention公式中要除以√dk?这个操作有什么作用? 考察对Transformer中缩放点积注意力原理的理解第 234 题Transformer的位置编码中为什么将基底设为10000? 考察对Transformer位置编码设计原理和参数选择的理解第 235 题请解释循环神经网络(RNN)的核心思想,并阐述它的主要特性以及存在哪些不足。 考查对循环神经网络基础概念、工作机制和局限性的理解。第 236 题请说明在文本分类任务中,Word Embedding 的应用方式有哪些? 考查对词向量表示及其在文本分类中应用的理解。