互联网/IT行业面试题 · Transformer
互联网/IT行业相关面试题,按题目行业基础数据聚合。
共 47588 道真题 · 当前筛选命中 348 道 · 更新 2026-08-05
筛选题目已选:Transformer
考察点
技术栈
第 61 题GPT 模型使用的激活函数有哪些? 考察对 Transformer 激活函数及其位置和原因的理解第 62 题Transformer的编码器和解码器的处理过程以及它们的区别是什么? 考察对Transformer架构核心组件处理流程及其差异的理解第 63 题请手写Transformer的核心结构,并解释各模块的作用。 考察对Transformer架构细节的理解和编码实现能力第 64 题请解释Transformer中的attention机制的工作原理,并说明为什么需要multi-head attention。 考察对attention机制及其多头的原理理解第 65 题请详细说明Transformer模型的核心结构组成及其各组件的作用。 考察对Transformer架构的深入理解与模块间关系的把握第 66 题如何构建长序列模型来处理超长输入? 考察对长序列建模的架构设计与性能权衡第 67 题经典的微调算法有哪些? 考察对预训练模型常见微调范式的理解和区分能力第 68 题介绍一下 Transformer 的整体架构和核心组件。 考察对 Transformer 架构的理解与表达清晰度第 69 题Transformer和CNN有什么不同? 考察对两种主流网络架构的机制理解与适用场景辨析第 70 题除 Decoder-only 外,Transformer 的 Encoder-only 与 Encoder-Decoder 架构分别适合什么任务? 考察对 Transformer 变体任务适配的理解第 71 题请比较 Transformer 中 Pre-LayerNorm 与 Post-LayerNorm 的差异及其影响。 考察候选人对 Transformer 归一化结构差异及其训练特性影响的理解第 72 题具体讲解Transformer中前馈层的设计 考察对Transformer前馈网络的结构、作用及与注意力机制配合的理解第 73 题Transformer 中为什么使用 Layer Normalization(LN)而不是 Batch Normalization(BN)? 考察对 LN 与 BN 区别及在序列模型中的适用性的理解第 74 题如何降低 Transformer 的计算复杂度?请列举主要方法。 考察对 Transformer 注意力机制瓶颈的认知及常用优化手段第 75 题Transformer默认采用哪种位置编码?请说明其思想并介绍相对位置编码。 考察位置编码的实现方式及对位置信息的建模理解第 76 题你了解 Transformer 或 Attention 机制的其他变体或改进吗? 考察对Attention机制及Transformer架构的深入理解与扩展知识第 77 题请说明Transformer的整体模型结构及其关键组件。 考察对Transformer架构核心组成与设计原理的理解第 78 题请画出并解释Transformer的整体结构,说明其数据从输入到输出的工作流程,并列举其中关键组件的作用。 考察对Transformer架构的完整理解,包括结构、流程和各组件功能第 79 题position embedding 和 input 是怎么融合的? 考察对 Transformer 中位置编码与输入表征融合方式的理解第 80 题你说你之前做过深度学习,那你知道为什么AI会容易忘记上下文吗? 考察对上下文管理机制与长文本处理瓶颈的理解