人工智能面试题 · DeepSpeed
人工智能相关岗位面试题。
共 11389 道真题 · 当前筛选命中 84 道 · 更新 2026-08-05
筛选题目已选:DeepSpeed
考察点
技术栈
第 61 题你提到用DeepSpeed做SFT训练,请讲一下DeepSpeed ZeRO Stage1-3的区别,以及什么时候用FSDP会更好? 考察对分布式训练显存优化技术的理解与选型能力第 62 题请详细介绍 DeepSpeed 的三阶段优化策略及其适用场景。 考察对 DeepSpeed ZeRO 优化原理的理解及工程选型能力第 63 题如果不用LoRA,直接全参数微调一个7B模型,需要多少显存? 考察混合精度下全参数微调的显存估算能力第 64 题Agentic长文本训练时候容易OOM,你有什么好的优化吗? 考察大模型长文本训练的内存优化策略与工程实践第 65 题用过DeepSpeed等大模型训练框架吗? 考察候选人实际使用大模型训练框架的经验深度和理解第 66 题SFT(监督微调)怎么做?有没有用什么加速训练的方法? 考察对大模型监督微调流程和训练加速技术的掌握第 67 题请介绍DeepSpeed中并行训练的关键知识点,包括数据并行、模型并行、流水线并行和ZeRO等。 考察对深度学习分布式并行训练中DeepSpeed框架核心机制的理解第 68 题DeepSpeed ZeRO-3 为什么比 ZeRO-2 更省显存? 考察对 ZeRO 并行策略内存优化原理的理解第 69 题讲讲DeepSpeed几个阶段,分别分片什么、代价是什么 考察对DeepSpeed ZeRO优化器各阶段分片策略及其通信和内存代价的理解第 70 题请解释ZeRO(零冗余优化器)的原理及其相对于传统数据并行的优势。 考察对大规模深度学习分布式训练中显存优化机制的理解第 71 题LangChain 相比 vLLM 和 DeepSpeed 有哪些优势? 考察对 LangChain 生态定位与推理/训练框架差异的理解第 72 题请解释 DeepSpeed 的原理,以及 ZeRO 的 stage 1、2、3 分别是怎么实现的? 考察对大规模模型训练内存优化机制的理解第 73 题请解释DeepSpeed中ZeRO-1、ZeRO-2和ZeRO-3三种模式的核心区别,并说明各自适用的训练场景。 考察对ZeRO并行策略原理的理解和实际应用场景第 74 题询问除DeepSpeed外使用过的其他优化方法 考察对深度学习训练优化方法的了解与实战经验第 75 题DeepSpeed ZeRO 各阶段分别做了哪些优化? 考察对分布式训练显存优化技术 ZeRO 各阶段原理的理解第 76 题你了解分布式训练吗?是否使用过 DeepSpeed? 考察分布式训练基础与 DeepSpeed 的实际掌握程度第 77 题DeepSpeed 的三个阶段在分配参数时,单机 8 卡和双机 16 卡,每张卡上分配的参数量是一样的吗?为什么? 考察对 DeepSpeed ZeRO 分片机制和集群规模对参数分配影响的理解第 78 题训练大模型的框架都有哪些呢? 考察对深度学习框架及其在大模型训练场景中的适用性的了解第 79 题是否使用过DDP和DeepSpeed?请说明二者的区别。 考察对分布式训练框架的理解与实际使用经验第 80 题请说明 DeepSpeed ZeRO 的三种优化阶段(ZeRO-1、ZeRO-2、ZeRO-3)分别优化什么,并解释其工作原理。 考察对分布式训练中显存优化技术 DeepSpeed ZeRO 的理解深度