人工智能面试题 · 问题拆解 · PyTorch
人工智能相关岗位面试题。
共 11389 道真题 · 当前筛选命中 48 道 · 更新 2026-08-05
筛选题目已选:问题拆解 · PyTorch
考察点
技术栈
第 1 题tensor.detach()和tensor.item()有哪些区别,分别对应什么使用场景? 考察对PyTorch张量操作语义和梯度传播机制的理解第 2 题请阐述ViT的结构、计算复杂度以及它如何应用于图像分类。 考察对ViT架构原理、复杂度来源和任务适配的理解第 3 题请说明使用 PyTorch/CUDA 实现四线性插值的思路,并给出基本伪代码。 考察对高维插值的理解、PyTorch 与 CUDA 并行编程设计能力第 4 题影响大语言模型训练和推理显存占用的关键因素有哪些?请从训练和推理两个场景分别说明。 考察对显存占用核心因素的全面理解与对比能力第 5 题请实现一个简单的多层感知机(MLP),并从 CSV 文件读取训练数据。 考察深度学习基础建模与数据读取、训练流程实现能力第 6 题实现多头注意力机制(torch或者numpy) 考察对多头注意力机制原理的理解和代码实现能力第 7 题请手写实现一个 Transformer Encoder 的核心结构。 考察对 Transformer Encoder 的结构理解与代码实现能力第 8 题请解释PyTorch中计算图的概念,并说明它的构建和动态特性,以及这对反向传播有何影响。 考察对PyTorch计算图机制及其与反向传播关系的理解第 9 题PyTorch如何反向传播,如果一个层被冻结了,上一层的梯度如何传播? 考察对自动求导机制和requires_grad冻结的理解第 10 题请解释重参数化技巧的原理及其在变分自编码器中的作用。 考察对生成模型中重参数化技巧原理及其作用的理解第 11 题请估算一个7B参数的大语言模型在推理时的显存占用,并说明估算思路。 考察对大模型参数量与显存关系、推理时内存构成的理解能力第 12 题clone()和detach()的区别 考察对PyTorch张量操作中克隆与分离语义的理解第 13 题手写实现 Self-Attention 的核心计算过程 考察对自注意力机制数学原理与实现的掌握第 14 题请介绍 PyTorch 的核心基础概念,包括张量、自动求导和模型训练的基本流程。 考察对 PyTorch 基础知识的理解和表达能力第 15 题训练一个 7B 参数规模的模型大约需要多少显存?不同 DeepSpeed ZeRO 阶段分别能节省多少显存? 考察对大模型训练显存开销构成及 ZeRO 优化策略的理解第 16 题请解释反向传播(Backpropagation)算法的基本原理与实现要点。 考察对反向传播算法核心概念及其在PyTorch中实现的理解第 17 题请手动实现多头注意力机制(MHA)的核心代码。 考察对Transformer多头注意力机制的深入理解与编码实现能力第 18 题对于一个约 7B 参数的模型,如果使用 AdamW 优化器进行训练,大致需要多少显存? 考察对训练显存构成(参数、梯度、优化器状态)的整体估算能力第 19 题请介绍RLHF的整体流程,并说明PPO与DPO的核心思想,写出两者的Loss表达式。 考察强化学习与人类反馈对齐算法的原理理解和公式掌握第 20 题讲一下知识蒸馏的原理,以及其中 KL 散度的公式是什么? 考察对知识蒸馏机制和核心数学工具的理解