互联网/IT行业面试题 · tech:pytorch

互联网/IT行业相关面试题,按题目行业基础数据聚合。

47588 道真题 · 当前筛选命中 71 · 更新 2026-08-05

筛选题目已选:tech:pytorch
第 1 题卷积网络中的卷积是如何对特征进行操作的?请结合其机制简要说明。 考察对卷积操作原理和特征提取过程的理解问题拆解技术原理CNNPyTorchTensorFlow第 2 题请描述从Checkpoint恢复模型的完整流程,包括代码和注意事项。 考察对模型训练中断恢复机制的理解与实操能力编码实现技术原理问题排查PyTorch第 3 题请实现多头自注意力机制(Multi-Head Self-Attention),并说明其计算过程。 考察对多头自注意力机制的理解与动手实现能力编码实现问题拆解技术原理PyTorch第 4 题请手写实现Transformer Decoder层,并说明如何实现mask机制以支持自回归生成。 考察对Transformer Decoder结构、自注意力mask和因果掩码的实现能力编码实现问题拆解技术原理PyTorchTransformer第 5 题Adam优化器相比SGD(随机梯度下降)改进了哪些方面? 考察对优化算法演进原理的理解,重点在自适应学习率与动量机制性能优化技术原理PyTorch第 6 题训练一个 7B 参数规模的模型大约需要多少显存?不同 DeepSpeed ZeRO 阶段分别能节省多少显存? 考察对大模型训练显存开销构成及 ZeRO 优化策略的理解问题拆解技术原理方案权衡DeepSpeedPyTorch第 7 题大模型训练有哪几种并行方式,各自解决什么问题? 考察对分布式训练并行策略的整体认知系统设计技术原理DeepSpeedPyTorch第 8 题讲解Transformer结构时,通常使用哪些深度学习训练框架? 考察对Transformer实现与主流深度学习框架的熟悉程度技术原理技术选型PyTorchTensorFlow第 9 题请介绍DeepSpeed中并行训练的关键知识点,包括数据并行、模型并行、流水线并行和ZeRO等。 考察对深度学习分布式并行训练中DeepSpeed框架核心机制的理解技术原理方案权衡DeepSpeedPyTorch第 10 题Agentic长文本训练时候容易OOM,你有什么好的优化吗? 考察大模型长文本训练的内存优化策略与工程实践性能优化技术原理方案权衡DeepSpeedPyTorch第 11 题请手写实现一个 Transformer Encoder 的核心结构。 考察对 Transformer Encoder 的结构理解与代码实现能力编码实现问题拆解技术原理PyTorchTransformer第 12 题请介绍 Qwen 2.5 VL 的图片输入处理与 Loss 设计细节。 考察对多模态模型图像编码、输入拼接与训练目标的深入理解技术原理方案权衡PyTorch第 13 题手撕全连接层,实现forward 考察对神经网络全连接层前向传播的数学原理和代码实现能力编码实现技术原理NumPyPyTorch第 14 题FFN(前馈神经网络)有什么不同,请写出ReLU和SwiGLU的实现。 考察对不同FFN变体的理解及动手实现能力编码实现技术原理PyTorch第 15 题在模型架构的层次划分上,PyTorch、TensorFlow 和 PaddlePaddle 分别处于哪一层? 考察对深度学习框架分层抽象的理解,以及跨框架的横向对比能力技术原理技术选型PyTorchTensorFlow第 16 题如果不用LoRA,直接全参数微调一个7B模型,需要多少显存? 考察混合精度下全参数微调的显存估算能力性能优化技术原理DeepSpeedPyTorch第 17 题在监督微调(SFT)中,如何实现损失函数只计算回答部分而忽略提示词和 padding token? 考察对 SFT 训练细节、标签构造和损失计算的理解编码实现问题拆解技术原理PyTorch第 18 题请手写实现多头注意力机制(MHA)的核心代码。 考察对Transformer多头注意力机制的理解与编码实现能力编码实现问题拆解技术原理PyTorch第 19 题请用 PyTorch 编写 SFT 训练中的损失计算代码,并说明为什么需要将标签序列右移一位。 考察 masked language modeling 损失实现与序列对齐理解编码实现技术原理PyTorch第 20 题训练一个7B模型,在常见的混合精度训练下大约需要多少显存?请简要说明主要消耗来源。 考察对模型训练显存占用的量级估算和构成理解性能优化问题拆解技术原理PyTorch