字节跳动面试题 · Transformer
字节跳动相关面试题,按最终去重题目聚合。
共 3252 道真题 · 当前筛选命中 76 道 · 更新 2026-08-05
筛选题目已选:Transformer
考察点
技术栈
第 41 题请解释 Transformer 的核心原理,并说明它为什么能取代 RNN 成为主流模型。 考察对 Transformer 架构的深入理解及技术演进认知第 42 题Transformer和LLaMA的Layer Normalization有什么区别?请手写RMSNorm。 考察对模型架构中归一化机制的理解及编码实现能力第 43 题相比之下,Decoder-only相比Encoder-Decoder架构有哪些具体优势? 考察对两类架构差异的深入辨析能力第 44 题当 Transformer 网络层数过深导致训练不稳定时,你会如何处理? 考察对深层 Transformer 训练稳定性问题的理解与解决手段第 45 题Transformer架构为什么要切分为多头? 考察对多头注意力机制设计动机与效果的理解第 46 题在Transformer的encoder中,感受野理论上覆盖所有token。你认为感受野越大越好还是越小越好?请说明你的判断依据和潜在权衡。 考察对Transformer全局注意力机制原理、性能与计算开销权衡的理解第 47 题请介绍大模型主流模型结构的主要演进变化 考察对大模型架构演进、关键技术变革的理解第 48 题请比较正余弦位置编码(如Transformer原始实现)与RoPE(旋转位置编码)的异同,并说明RoPE相对于正余弦编码的优势。 考察对位置编码原理及其演进的理解,特别是RoPE的设计动机与优势第 49 题Transformer 中的 Q、K、V 分别是什么含义? 考察对注意力机制核心概念的理解第 50 题GPT 模型使用的激活函数有哪些? 考察对 Transformer 激活函数及其位置和原因的理解第 51 题Transformer位置编码为什么选择基于正弦和余弦函数的sincos编码? 考察对sincos位置编码设计原理的理解,包括相对位置和学习特性第 52 题请解释Self-Attention机制的原理及其在Transformer中的作用。 考察对注意力机制核心思想与计算流程的理解第 53 题如何降低 Transformer 的计算复杂度?请列举主要方法。 考察对 Transformer 注意力机制瓶颈的认知及常用优化手段第 54 题Attention结果为什么最后需要接一个全连接层再进行输出,作用是什么? 考察对Transformer中Attention输出与全连接层作用的理解第 55 题transformer的 attention 中的 QKV 是一样的吗? 考察注意力机制中 Q、K、V 的角色和来源第 56 题请介绍BERT的模型结构及其核心组件。 考察对BERT架构的理解,包括Transformer层、注意力机制和预训练任务第 57 题请介绍几种常见的稀疏注意力变体,并说明其核心思想与适用场景。 考察对主流稀疏注意力机制的系统性了解与选型判断第 58 题transformer里使用了什么激活函数? 考察对Transformer激活函数及其作用的掌握第 59 题如果Transformer的注意力机制中把K去掉,变成QQV,会有什么问题? 考察对注意力机制中键(K)作用的理解,以及去掉K后带来的影响第 60 题实习时你微调过Qwen2,请说说Qwen2的模型结构,以及相比Qwen1做了哪些改进? 考察对大语言模型结构演进的理解和对比分析能力