字节跳动面试题 · 技术原理 · tech:pytorch
字节跳动相关面试题,按最终去重题目聚合。
共 3252 道真题 · 当前筛选命中 12 道 · 更新 2026-08-05
筛选题目已选:技术原理 · tech:pytorch
考察点
技术栈
第 1 题讲解Transformer结构时,通常使用哪些深度学习训练框架? 考察对Transformer实现与主流深度学习框架的熟悉程度第 2 题请手写实现多头注意力的核心计算过程。 考察对自注意力机制、多头拆分与拼接的编码实现能力第 3 题手撕全连接层,实现forward 考察对神经网络全连接层前向传播的数学原理和代码实现能力第 4 题请手写实现一个标准的Scaled Dot-Product Attention,并说明其计算流程。 考察对Transformer核心注意力机制的实现理解与推导能力第 5 题FFN(前馈神经网络)有什么不同,请写出ReLU和SwiGLU的实现。 考察对不同FFN变体的理解及动手实现能力第 6 题你了解哪些大模型训练和推理优化的方法? 考察对模型训练与推理阶段常见优化手段的理解广度与深度第 7 题请手写并解释交叉熵损失函数。 考察对交叉熵损失的理解、实现及其在分类任务中的作用第 8 题Transformer和LLaMA的Layer Normalization有什么区别?请手写RMSNorm。 考察对模型架构中归一化机制的理解及编码实现能力第 9 题请手写实现一个 cross-attention 层,并说明其与 self-attention 的区别。 考察对注意力机制原理的理解及代码实现能力第 10 题详细描述,如果给一个txt存储的文本,从预处理到SFT的训练流程,要包括对数据的预处理、tokenize、forward、loss计算、参数更新,越细越好。 考察大模型SFT全流程的技术细节与工程实现能力第 11 题请用 PyTorch 编写 SFT 训练中的损失计算代码,并说明为什么需要将标签序列右移一位。 考察 masked language modeling 损失实现与序列对齐理解第 12 题请手写对比学习的损失函数计算,并说明其关键组件。 考察对比学习损失函数的实现细节与设计理解