互联网/IT行业面试题 · Transformer
互联网/IT行业相关面试题,按题目行业基础数据聚合。
共 47588 道真题 · 当前筛选命中 348 道 · 更新 2026-08-05
筛选题目已选:Transformer
考察点
技术栈
第 181 题请介绍 Transformer 模型的核心结构与工作原理,并说明其关键机制。 考察对 Transformer 架构、自注意力机制及其在序列建模中优势的理解第 182 题Transformer 的 Encoder 可以去掉 FFN(前馈网络)吗?为什么?是否可行? 考察对 Transformer 结构各组件作用及权衡的理解第 183 题请介绍你对大语言模型和多模态大模型发展脉络的了解,并谈谈 Transformer、BERT、GPT、LLaMA、Qwen 系列以及 o1 推理模型各自的关键贡献与联系。 考察对生成式AI技术演进、代表性模型核心贡献及代际关系的理解第 184 题大模型实现的原理大概是怎样的? 考察对大语言模型核心原理的整体理解与表述能力第 185 题请介绍 Transformer 模型的核心结构,并说明其相比传统循环神经网络的主要优势。 考察对 Transformer 架构的理解和对比能力第 186 题单头注意力在 Transformer 中有什么局限性? 考察单头注意力的表达瓶颈与多头优势的对比第 187 题针对梯度爆炸和消失问题,近年有哪些新的改进方法或研究方向? 考察对深度学习训练稳定性的前沿了解第 188 题请描述BERT模型的预训练目标及其如何利用双向上下文。 考察对BERT预训练机制与双向编码原理的理解第 189 题请分析Self-Attention的时间复杂度,并与RNN进行对比。 考察时间复杂度分析与模型特性比较能力第 190 题Transformer中Encoder和Decoder的注意力机制分别是什么?Decoder中的注意力机制能否称为Self-Attention? 考察Transformer架构中注意力机制的类型区分与原理理解第 191 题Transformer现有架构在什么情况下,哪个模块会导致用户意图判别不准? 考察对Transformer各模块原理及意图判别失败场景的理解第 192 题请比较MHA(多头注意力)和GQA(分组查询注意力)的异同,并说明GQA的实际应用场景。 考察对Transformer注意力机制变体的理解与工程权衡第 193 题主流LLM模型结构设计有什么特点? 考察对现代大语言模型架构设计的理解与归纳能力第 194 题序列中每个token的embedding经过多层self-attention后变得越来越相似,原因是什么? 考察对Transformer中self-attention各层表征退化和各向异性现象的理解第 195 题介绍Transformer原理 考察对Transformer架构核心机制的理解第 196 题Transformer 编码器中的前馈网络(FFN)起什么作用?为什么需要它? 考察对 Transformer 编码器结构中 FFN 作用与必要性的理解第 197 题你了解 ChatGPT 的模型和原理吗?请简述其核心工作机制。 考察对大语言模型基础原理的理解深度第 198 题Transformer和LSTM推理的过程有什么差异? 考察对两种架构推理阶段计算特性与自回归生成机制的理解第 199 题为什么缩放点积注意力中要除以根号下d_k(键的维度)? 考察对缩放因子作用的数学理解第 200 题Transformer 中 QK 为什么除以根号 d? 考察对注意力机制数值稳定性和softmax梯度问题的理解