小红书面试题 · tech:pytorch
小红书相关面试题,按最终去重题目聚合。
共 2200 道真题 · 当前筛选命中 8 道 · 更新 2026-08-05
筛选题目已选:tech:pytorch
考察点
技术栈
第 1 题二分类任务通常使用什么损失函数?请写出 PyTorch 中 BCE 损失函数的代码。 考察二分类损失函数的选择与代码实现第 2 题在训练 DPO(Direct Preference Optimization)模型时,你通常会选择哪些主流的机器学习或深度学习库?请说明理由。 考察对 DPO 训练相关技术栈的了解及工具选型能力第 3 题显存占用通常与哪些因素有关?请列举并简要解释。 考察对大模型推理与训练中显存占用构成因素的理解第 4 题请手写实现一个标准的Scaled Dot-Product Attention,并说明其计算流程。 考察对Transformer核心注意力机制的实现理解与推导能力第 5 题对于一个约 7B 参数的模型,如果使用 AdamW 优化器进行训练,大致需要多少显存? 考察对训练显存构成(参数、梯度、优化器状态)的整体估算能力第 6 题对7B参数模型进行全参数微调,大约需要多少显存?请说明估算依据。 考察对大模型微调显存开销的估算能力与训练知识第 7 题深度学习有什么优化器?Adagrad、Adam和SGD的区别是什么? 考察深度学习优化器的理解与对比能力第 8 题对于一个约 7B 参数的模型,推理一个 token 大概需要多少显存?请给出估算思路。 考察对模型推理显存估算的工程直觉与计算能力