人工智能面试题 · PyTorch
人工智能相关岗位面试题。
共 11389 道真题 · 当前筛选命中 204 道 · 更新 2026-08-05
筛选题目已选:PyTorch
考察点
技术栈
第 101 题请实现多头自注意力机制(Multi-Head Self-Attention),并说明其计算过程。 考察对多头自注意力机制的理解与动手实现能力第 102 题你主要用过哪些深度学习框架? 考察深度学习框架的熟练程度与相关项目实践经验第 103 题请说明DeepSpeed ZeRO Stage 1、2、3之间的区别,以及在何种场景下更适合使用PyTorch FSDP。 考察对分布式训练显存优化技术的理解与选型能力第 104 题讲解 BatchNorm 和 LayerNorm 的原理,以及在 PyTorch 中的实现方式。 考察对两种归一化方法的原理理解与 PyTorch 落地能力第 105 题对7B参数模型进行全参数微调,大约需要多少显存?请说明估算依据。 考察对大模型微调显存开销的估算能力与训练知识第 106 题请介绍混合精度计算的基本原理及其在深度学习训练中的实践要点。 考察对混合精度训练的机制理解、数值稳定性处理及框架实践第 107 题PyTorch中register_parameter和buffer的区别是什么? 考察对PyTorch模块参数管理机制的理解第 108 题请介绍你在 PyTorch 等深度学习框架上的使用经验,以及是否独立搭建过模型。 考察深度学习框架的实际使用深度与独立建模能力第 109 题用PyTorch实现一个图片分类网络,要求编写__init__和forward方法。 考察PyTorch模型定义与图像分类网络结构设计能力第 110 题在深度学习中,梯度下降的作用是什么?损失函数如何影响模型训练? 考察对梯度下降和损失函数在模型训练中核心作用的理解第 111 题请实现 Multi-Head Attention(MHA),说明其结构和计算流程。 考察多头注意力机制的实现正确性与核心概念理解第 112 题请分别解释梯度累计、梯度检查点(gradient checkpointing)、联邦学习、分布式训练中的负载卸载(offload),以及它们在大型模型训练中的作用和适用场景。 考察对大型模型训练中核心优化技术的理解深度和应用边界第 113 题请介绍你了解的深度学习优化器,包括它们的工作原理、适用场景和优缺点。 考察对优化算法原理的理解、对比分析能力和实际选型意识第 114 题请手写实现多头注意力机制的核心代码。 考察多头注意力机制的原理理解与编码实现能力第 115 题请用PyTorch基础语法实现一个Tokenizer。 考察对PyTorch张量操作和文本预处理基础能力第 116 题请编写多头自注意力模块的前向传播(forward)实现,并说明关键步骤。 考察注意力机制实现与关键细节第 117 题请手写并解释交叉熵损失函数。 考察对交叉熵损失的理解、实现及其在分类任务中的作用第 118 题想要做模型部署推理加速应该如何学习? 考察对模型部署推理加速领域的知识体系构建与学习路径规划第 119 题请说明 PyTorch 中两种不同浮点类型(如 float32 与 float64)混合运算时的类型转换规则。 考察对 PyTorch 数值类型提升机制的理解第 120 题请写出 GRPO 的优化目标函数,并解释其各组成部分的作用。 考察对 GRPO 目标函数构成与数学表达的掌握