互联网/IT行业面试题 · 技术原理 · Transformer
互联网/IT行业相关面试题,按题目行业基础数据聚合。
共 47588 道真题 · 当前筛选命中 344 道 · 更新 2026-08-05
筛选题目已选:技术原理 · Transformer
考察点
技术栈
第 181 题请介绍你对大语言模型和多模态大模型发展脉络的了解,并谈谈 Transformer、BERT、GPT、LLaMA、Qwen 系列以及 o1 推理模型各自的关键贡献与联系。 考察对生成式AI技术演进、代表性模型核心贡献及代际关系的理解第 182 题大模型实现的原理大概是怎样的? 考察对大语言模型核心原理的整体理解与表述能力第 183 题请介绍 Transformer 模型的核心结构,并说明其相比传统循环神经网络的主要优势。 考察对 Transformer 架构的理解和对比能力第 184 题单头注意力在 Transformer 中有什么局限性? 考察单头注意力的表达瓶颈与多头优势的对比第 185 题针对梯度爆炸和消失问题,近年有哪些新的改进方法或研究方向? 考察对深度学习训练稳定性的前沿了解第 186 题请描述BERT模型的预训练目标及其如何利用双向上下文。 考察对BERT预训练机制与双向编码原理的理解第 187 题请分析Self-Attention的时间复杂度,并与RNN进行对比。 考察时间复杂度分析与模型特性比较能力第 188 题Transformer中Encoder和Decoder的注意力机制分别是什么?Decoder中的注意力机制能否称为Self-Attention? 考察Transformer架构中注意力机制的类型区分与原理理解第 189 题Transformer现有架构在什么情况下,哪个模块会导致用户意图判别不准? 考察对Transformer各模块原理及意图判别失败场景的理解第 190 题请比较MHA(多头注意力)和GQA(分组查询注意力)的异同,并说明GQA的实际应用场景。 考察对Transformer注意力机制变体的理解与工程权衡第 191 题主流LLM模型结构设计有什么特点? 考察对现代大语言模型架构设计的理解与归纳能力第 192 题序列中每个token的embedding经过多层self-attention后变得越来越相似,原因是什么? 考察对Transformer中self-attention各层表征退化和各向异性现象的理解第 193 题介绍Transformer原理 考察对Transformer架构核心机制的理解第 194 题Transformer 编码器中的前馈网络(FFN)起什么作用?为什么需要它? 考察对 Transformer 编码器结构中 FFN 作用与必要性的理解第 195 题你了解 ChatGPT 的模型和原理吗?请简述其核心工作机制。 考察对大语言模型基础原理的理解深度第 196 题Transformer和LSTM推理的过程有什么差异? 考察对两种架构推理阶段计算特性与自回归生成机制的理解第 197 题为什么缩放点积注意力中要除以根号下d_k(键的维度)? 考察对缩放因子作用的数学理解第 198 题Transformer 中 QK 为什么除以根号 d? 考察对注意力机制数值稳定性和softmax梯度问题的理解第 199 题Transformer和LLaMA的Layer Normalization有什么区别?请手写RMSNorm。 考察对模型架构中归一化机制的理解及编码实现能力第 200 题请介绍 Transformer 中 Q、K、V 分别的作用是什么? 考察对注意力机制核心概念的理解