互联网/IT行业面试题 · 编码实现 · PyTorch
互联网/IT行业相关面试题,按题目行业基础数据聚合。
共 47588 道真题 · 当前筛选命中 33 道 · 更新 2026-08-05
筛选题目已选:编码实现 · PyTorch
考察点
技术栈
第 1 题请描述从Checkpoint恢复模型的完整流程,包括代码和注意事项。 考察对模型训练中断恢复机制的理解与实操能力第 2 题请实现多头自注意力机制(Multi-Head Self-Attention),并说明其计算过程。 考察对多头自注意力机制的理解与动手实现能力第 3 题请手写实现Transformer Decoder层,并说明如何实现mask机制以支持自回归生成。 考察对Transformer Decoder结构、自注意力mask和因果掩码的实现能力第 4 题请手写实现一个 Transformer Encoder 的核心结构。 考察对 Transformer Encoder 的结构理解与代码实现能力第 5 题手撕全连接层,实现forward 考察对神经网络全连接层前向传播的数学原理和代码实现能力第 6 题FFN(前馈神经网络)有什么不同,请写出ReLU和SwiGLU的实现。 考察对不同FFN变体的理解及动手实现能力第 7 题在监督微调(SFT)中,如何实现损失函数只计算回答部分而忽略提示词和 padding token? 考察对 SFT 训练细节、标签构造和损失计算的理解第 8 题请手写实现多头注意力机制(MHA)的核心代码。 考察对Transformer多头注意力机制的理解与编码实现能力第 9 题请用 PyTorch 编写 SFT 训练中的损失计算代码,并说明为什么需要将标签序列右移一位。 考察 masked language modeling 损失实现与序列对齐理解第 10 题请实现 Multi-Head Attention(MHA),说明其结构和计算流程。 考察多头注意力机制的实现正确性与核心概念理解第 11 题请手写实现一个 cross-attention 层,并说明其与 self-attention 的区别。 考察对注意力机制原理的理解及代码实现能力第 12 题如何随机生成一个张量?请给出至少一种常用方法。 考察对随机张量生成API的熟悉程度第 13 题请实现并解释一个 Multi-Head Attention 模块。 考察多头注意力机制的理解、编码实现与代码解释能力第 14 题请手写并解释交叉熵损失函数。 考察对交叉熵损失的理解、实现及其在分类任务中的作用第 15 题请用代码实现一个基础的自注意力(Self-Attention)机制。 考察对自注意力机制原理的理解与编码实现能力第 16 题请手写对比学习的损失函数计算,并说明其关键组件。 考察对比学习损失函数的实现细节与设计理解第 17 题请手写实现一个多门控专家混合(MMoE)模型的核心结构。 考察对多任务学习模型MMoE的理解与编码实现能力第 18 题请手写实现一个标准的Scaled Dot-Product Attention,并说明其计算流程。 考察对Transformer核心注意力机制的实现理解与推导能力第 19 题手撕 RoPE:对比 llama GitHub 源码中 rope 介绍与你的实现,说明区别和改进点。 考察对旋转位置编码原理与源码理解的一致性及细节掌握第 20 题请编写多头自注意力模块的前向传播(forward)实现,并说明关键步骤。 考察注意力机制实现与关键细节