人工智能面试题 · PyTorch

人工智能相关岗位面试题。

11389 道真题 · 当前筛选命中 204 · 更新 2026-08-05

筛选题目已选:PyTorch
第 121 题DP和DDP的原理区别是什么? 考察数据并行与分布式数据并行的核心机制差异技术原理方案权衡PyTorch第 122 题请编写一个多头注意力机制的代码实现。 考察对注意力机制原理的理解及编程实现能力编码实现技术原理PyTorchTransformer第 123 题请实现一个多头自注意力机制(Multi-Head Self-Attention)。 考察对Transformer核心组件的理解及编码实现能力编码实现技术原理PyTorchTransformer第 124 题请实现一个Tokenizer,要求只能用PyTorch基础语法完成。 考察用PyTorch基础操作实现文本分词器的能力,兼顾算法与工程实现编码实现问题拆解技术原理PyTorch第 125 题PyTorch里的tensor和NumPy的区别 考察对张量数据结构、计算能力和生态差异的理解技术原理方案权衡NumPyPyTorch第 126 题在SFT训练中,如何确保只对指定部分(如响应)计算loss? 考察对训练实现中loss掩码机制的理解编码实现技术原理PyTorch第 127 题你是否会自己手写深度学习训练框架? 考察对深度学习训练流程的理解深度与实际工程实践能力项目复盘自我认知技术原理PyTorch第 128 题请用 PyTorch 手写实现 softmax 函数,并基于 softmax 的输出分布编写一个采样函数。 考察 softmax 的实现正确性、数值稳定性与基于分布的采样能力编码实现技术原理PyTorch第 129 题请用 PyTorch 实现一个 ImageDataset 类,继承自 Dataset 用于加载给定的图像数据集,并实现一个 collate_fn 函数,用于将数据集中的样本打包成批次。 考察对 PyTorch Dataset 和 DataLoader collate_fn 机制的理解及编码实现能力编码实现问题拆解技术原理PyTorch第 130 题如何将 tensor 转到指定 device? 考察 PyTorch 中张量设备迁移的基本操作与最佳实践技术原理PyTorch第 131 题手撕多头注意力机制的实现,并解释为什么缩放因子是根号下dk。 考察多头注意力机制的实现细节与缩放因子的数学原理编码实现技术原理PyTorch第 132 题如何将一个 Tensor 转换为 NumPy 数组? 考察对张量转回 NumPy 数组操作及设备限制的理解编码实现技术原理NumPyPyTorchTensorFlow第 133 题请手写并解释多头注意力(Multi-Head Attention)机制的代码实现。 考察多头注意力的实现细节与原理理解编码实现技术原理PyTorch第 134 题在不修改数据集的前提下,如何修改PyTorch代码解决多分类中的数据不平衡问题? 考察在不改动数据时通过代码层面处理不平衡的能力编码实现数据驱动技术原理PyTorch第 135 题Transformer和LLaMA的Layer Normalization有什么区别?请手写RMSNorm。 考察对模型架构中归一化机制的理解及编码实现能力编码实现技术原理PyTorchTransformer第 136 题请介绍你在分布式训练方面的经验,尤其是使用 PyTorch 的分布式训练相关模块(如 DistributedDataParallel)时,你如何处理模型并行或数据并行,以及遇到了哪些挑战? 考察分布式训练的实际应用与问题解决能力系统设计技术原理问题排查PyTorch第 137 题SFT阶段如何避免对padding token计算loss? 考察大模型微调时对padding token的loss屏蔽处理及其原理编码实现技术原理PyTorch第 138 题请介绍几种常用的推荐系统深度学习模型及其适用场景。 考察对推荐系统深度学习模型的掌握程度与场景理解业务理解技术原理技术选型PyTorchTensorFlow第 139 题训练一个7B模型,在常见的混合精度训练下大约需要多少显存?请简要说明主要消耗来源。 考察对模型训练显存占用的量级估算和构成理解性能优化问题拆解技术原理PyTorch第 140 题介绍下DeepSpeed 考察对DeepSpeed核心机制、应用场景与性能优化原理的理解性能优化技术原理DeepSpeedPyTorch