字节跳动面试题 · 编码实现 · PyTorch

字节跳动相关面试题,按最终去重题目聚合。

3252 道真题 · 当前筛选命中 10 · 更新 2026-08-05

筛选题目已选:编码实现 · PyTorch
第 1 题请手写实现多头注意力的核心计算过程。 考察对自注意力机制、多头拆分与拼接的编码实现能力编码实现技术原理PyTorch第 2 题手撕全连接层,实现forward 考察对神经网络全连接层前向传播的数学原理和代码实现能力编码实现技术原理NumPyPyTorch第 3 题请手写实现一个标准的Scaled Dot-Product Attention,并说明其计算流程。 考察对Transformer核心注意力机制的实现理解与推导能力编码实现技术原理PyTorch第 4 题FFN(前馈神经网络)有什么不同,请写出ReLU和SwiGLU的实现。 考察对不同FFN变体的理解及动手实现能力编码实现技术原理PyTorch第 5 题请手写并解释交叉熵损失函数。 考察对交叉熵损失的理解、实现及其在分类任务中的作用编码实现技术原理PyTorch第 6 题Transformer和LLaMA的Layer Normalization有什么区别?请手写RMSNorm。 考察对模型架构中归一化机制的理解及编码实现能力编码实现技术原理PyTorchTransformer第 7 题请手写实现一个 cross-attention 层,并说明其与 self-attention 的区别。 考察对注意力机制原理的理解及代码实现能力编码实现技术原理PyTorch第 8 题详细描述,如果给一个txt存储的文本,从预处理到SFT的训练流程,要包括对数据的预处理、tokenize、forward、loss计算、参数更新,越细越好。 考察大模型SFT全流程的技术细节与工程实现能力编码实现问题拆解技术原理PyTorchTransformer第 9 题请用 PyTorch 编写 SFT 训练中的损失计算代码,并说明为什么需要将标签序列右移一位。 考察 masked language modeling 损失实现与序列对齐理解编码实现技术原理PyTorch第 10 题请手写对比学习的损失函数计算,并说明其关键组件。 考察对比学习损失函数的实现细节与设计理解编码实现问题拆解技术原理PyTorch