互联网/IT行业面试题 · 问题拆解 · tech:pytorch
互联网/IT行业相关面试题,按题目行业基础数据聚合。
共 47588 道真题 · 当前筛选命中 18 道 · 更新 2026-08-05
筛选题目已选:问题拆解 · tech:pytorch
考察点
技术栈
第 1 题卷积网络中的卷积是如何对特征进行操作的?请结合其机制简要说明。 考察对卷积操作原理和特征提取过程的理解第 2 题请实现多头自注意力机制(Multi-Head Self-Attention),并说明其计算过程。 考察对多头自注意力机制的理解与动手实现能力第 3 题请手写实现Transformer Decoder层,并说明如何实现mask机制以支持自回归生成。 考察对Transformer Decoder结构、自注意力mask和因果掩码的实现能力第 4 题训练一个 7B 参数规模的模型大约需要多少显存?不同 DeepSpeed ZeRO 阶段分别能节省多少显存? 考察对大模型训练显存开销构成及 ZeRO 优化策略的理解第 5 题请手写实现一个 Transformer Encoder 的核心结构。 考察对 Transformer Encoder 的结构理解与代码实现能力第 6 题在监督微调(SFT)中,如何实现损失函数只计算回答部分而忽略提示词和 padding token? 考察对 SFT 训练细节、标签构造和损失计算的理解第 7 题请手写实现多头注意力机制(MHA)的核心代码。 考察对Transformer多头注意力机制的理解与编码实现能力第 8 题训练一个7B模型,在常见的混合精度训练下大约需要多少显存?请简要说明主要消耗来源。 考察对模型训练显存占用的量级估算和构成理解第 9 题请实现并解释一个 Multi-Head Attention 模块。 考察多头注意力机制的理解、编码实现与代码解释能力第 10 题请手写对比学习的损失函数计算,并说明其关键组件。 考察对比学习损失函数的实现细节与设计理解第 11 题请说明车端算法效果的测评方法、所用工具及评估流程。 考察算法评测体系搭建、工具使用与指标解读能力第 12 题在使用 PyTorch 处理大规模数据集时,如果内存不足以一次性加载全部数据,通常使用哪个类或接口来按需读取数据? 考察对 PyTorch 数据加载机制的理解与实操能力第 13 题手撕 RoPE:对比 llama GitHub 源码中 rope 介绍与你的实现,说明区别和改进点。 考察对旋转位置编码原理与源码理解的一致性及细节掌握第 14 题详细描述,如果给一个txt存储的文本,从预处理到SFT的训练流程,要包括对数据的预处理、tokenize、forward、loss计算、参数更新,越细越好。 考察大模型SFT全流程的技术细节与工程实现能力第 15 题如果给你一张32B参数量、未量化的模型,你觉得跑起来大概需要多少显存? 考察对模型显存占用的估算能力和对推理过程的系统理解第 16 题手写实现 Self-Attention 的核心计算过程 考察对自注意力机制数学原理与实现的掌握第 17 题请估算一个7B参数的大语言模型在推理时的显存占用,并说明估算思路。 考察对大模型参数量与显存关系、推理时内存构成的理解能力第 18 题讲一下知识蒸馏的原理,以及其中 KL 散度的公式是什么? 考察对知识蒸馏机制和核心数学工具的理解