字节跳动面试题 · Transformer
字节跳动相关面试题,按最终去重题目聚合。
共 3252 道真题 · 当前筛选命中 76 道 · 更新 2026-08-05
筛选题目已选:Transformer
考察点
技术栈
第 21 题八股:Transformer Encoder 中 FFN 的作用是什么? 考察对 Transformer 前馈网络功能与设计原理的理解第 22 题介绍 Self-Attention 和 Cross-Attention 的区别与联系。 考察对注意力机制两种基本形式的理解及其应用场景第 23 题请描述BERT模型的预训练目标及其如何利用双向上下文。 考察对BERT预训练机制与双向编码原理的理解第 24 题在Transformer编码器内部,如果仅考虑自注意力操作,将K去掉改成QQV,具体会导致哪些计算或效果上的问题? 考察对注意力计算细节和技术后果的具体分析能力第 25 题Transformer 中 Encoder 与 Decoder 的自注意力机制有何区别? 考察对 Transformer 注意力机制结构差异及训练阶段行为的理解第 26 题手写实现Transformer编码器中的多头注意力机制(MHA),并简要说明各步骤。 考察对Transformer编码器与多头注意力机制的理解及代码实现能力第 27 题Transformer训练过程中为什么容易出现梯度消失或爆炸问题? 考察对Transformer训练稳定性的原理理解和优化手段第 28 题Transformer的FFN层为什么会逐渐演变成MOE层? 考察对Transformer中FFN与稀疏专家路由演进逻辑的理解第 29 题主流LLM模型结构设计有什么特点? 考察对现代大语言模型架构设计的理解与归纳能力第 30 题在Transformer中为什么要使用位置编码? 考察对Transformer结构无位置信息依赖的理解及位置编码的必要性第 31 题Linear Attention和Sparse Attention在实际模型中通常如何应用? 考察对高效注意力机制的理解及实际应用场景第 32 题Transformer 中 QK 为什么除以根号 d? 考察对注意力机制数值稳定性和softmax梯度问题的理解第 33 题请讲解 RoPE(旋转位置编码)的原理,并比较其他常用的位置编码方式,最后说明 RoPE 的主要优点。 考察对位置编码技术原理的理解、对比分析能力及应用洞察第 34 题请计算给定Transformer模型在一次前向推理中的FLOPs和内存开销。 考察对模型计算复杂度和显存占用的量化分析能力第 35 题Decoder-only模型在推理时,预测第i+1个token时,输入用的是第i个token的one-hot还是概率分布?为什么? 考察对自回归模型推理输入本质的理解,区分训练与推理阶段第 36 题请讲解MHA、MQA、GQA和MLA的原理与区别,并说明各自的适用场景。 考察对注意力机制变体的理解深度及工程选型考量第 37 题请手写正余弦位置编码的公式,并简要说明其设计思路。 考察对Transformer位置编码原理的掌握与推导能力第 38 题大模型是如何处理和分析用户输入的上下文的? 考察对Transformer上下文编码机制的理解第 39 题Transformer是encoder-decoder架构,而GPT是decoder-only架构,为什么会演变成这样一种形式?为什么把encoder给舍弃掉了? 考察对语言模型架构演进逻辑和decoder-only优势的理解第 40 题请阐述Transformer的原理以及和其他注意力机制的区别 考察对Transformer架构核心机制及其演进脉络的理解程度