人工智能面试题 · 方案权衡 · Transformer
人工智能相关岗位面试题。
共 11389 道真题 · 当前筛选命中 236 道 · 更新 2026-08-05
筛选题目已选:方案权衡 · Transformer
考察点
技术栈
第 121 题Transformer 用 BN 了吗? 考察对 Transformer 结构与 BatchNorm/LayerNorm 区别的理解第 122 题请讲解 RoPE(旋转位置编码)的原理,并比较其他常用的位置编码方式,最后说明 RoPE 的主要优点。 考察对位置编码技术原理的理解、对比分析能力及应用洞察第 123 题讲一讲为什么Transformer用LN而不用BN? 考察对归一化技术原理与Transformer架构特性的理解第 124 题Transformer和LSTM推理的过程有什么差异? 考察对两种架构推理阶段计算特性与自回归生成机制的理解第 125 题为什么Tiger模型采用encoder-decoder架构而不是decoder-only架构? 考察对Transformer架构设计权衡和模型选型的理解第 126 题请从结构角度对比大模型(Transformer)与BERT的主要改进点。 考察对Transformer衍生模型结构演变的掌握第 127 题请解释Transformer中多头注意力机制的「多头」具体指什么,以及它解决了什么问题。 考察对多头注意力机制设计动机与作用的深入理解第 128 题LLaMA中的Transformer与普通Transformer相比有哪些改进? 考察对LLaMA模型架构改进的深入理解与对比能力第 129 题介绍SwiGLU激活函数及其在Transformer中的应用。 考察对SwiGLU激活函数的原理、优势及在Transformer架构中应用的理解第 130 题我们现在是两阶段推荐架构:第一阶段召回用的是 embedding 点积召回,第二阶段是 MLP 跟 transformer 做多目标打分。那你觉得在我们这么大规模的数据量下,如果要做 real-time re-ranking,你会在架构上怎么做 trade-off?怎么压低 latency? 考察推荐系统实时重排架构的延迟与效果权衡能力第 131 题请解释Transformer中的自注意力机制,并介绍一种常见的注意力变体及其设计动机。 考察对自注意力机制的理解及对注意力变体的掌握第 132 题请讲解MHA、MQA、GQA和MLA的原理与区别,并说明各自的适用场景。 考察对注意力机制变体的理解深度及工程选型考量第 133 题请介绍几个你了解的大语言模型,并说明它们在模型结构上的主要差异。 考察对大模型技术谱系、结构差异与设计取舍的理解第 134 题Transformer相比RNN和LSTM有哪些不同? 考察对序列建模技术演进的理解与对比分析能力第 135 题请解释BERT模型的核心工作机制,并说明它相较于传统深度学习模型的主要优势。 考察对预训练语言模型原理的理解及与传统模型的对比能力第 136 题请说明 Transformer 与 RNN 在理论架构上的核心区别,以及这些区别在实际计算效率上的体现。 考察对 Transformer 与 RNN 架构差异及其计算特性的理解第 137 题为什么GPT采用单层(解码器)Transformer结构,而不是类似BERT的双向编码器? 考察对GPT生成式架构设计逻辑的理解第 138 题跨模态对齐如何做的,你都了解哪些对齐方式? 考察对跨模态对齐概念、常见对齐方法与实际应用的理解第 139 题Transformer注意力分数为何要做缩放(即为什么除以根号d)? 考察对注意力机制数学动机和数值稳定性的理解第 140 题Attention有什么缺点? 考察对注意力机制局限性的认识与权衡分析