小红书面试题 · 技术原理 · Transformer
小红书相关面试题,按最终去重题目聚合。
共 2200 道真题 · 当前筛选命中 28 道 · 更新 2026-08-05
筛选题目已选:技术原理 · Transformer
考察点
技术栈
第 1 题讲解FT-Transformer原理 考察对特征嵌入与Transformer结合机制的理解第 2 题Encoder中的self-attention和Decoder中的self-attention有什么区别? 考察对Transformer编码器与解码器注意力机制差异的理解第 3 题与原始 Transformer 相比,你在自己的工作中做了哪些改进?请说明动机、具体做法和效果。 考察候选人对 Transformer 的深入理解及实际工程中的改进能力第 4 题介绍一下Transformer的整体结构及其核心组成部分。 考察对Transformer架构的整体理解与关键组件的作用第 5 题你认为 Transformer 的性能瓶颈主要来源于哪里? 考察对 Transformer 计算和内存瓶颈的深入分析第 6 题使用 KV Cache 之后,效果与改进前相比有什么变化?请分析。 考察对 KV Cache 作用、效果与代价的理解第 7 题你针对Transformer特定层(如第二层)是否做过消融实验?结果如何? 考察候选人是否有针对模型结构某层进行消融实验的经验及分析能力第 8 题除了 Sparse 和 Linear 注意力之外,你还知道哪些加速 Transformer 的方法? 考察对加速方法前沿和广度的了解第 9 题位置编码(position embedding)通常用什么方法实现?除了基础方法,你还了解哪些方法? 考察对位置编码实现方式及其演进的掌握第 10 题计算softmax缩放因子时,假设每个值服从标准正态分布,还是只需均值0方差1即可? 考察对分布假设与推导关系精确理解第 11 题请分析 Transformer 模型的计算复杂度,并给出其核心机制(如自注意力)的伪代码。 考察对 Transformer 架构计算复杂度的理解和伪代码表达能力第 12 题你对Transformer注意力机制的复杂度有怎样的理解?如果将其应用到大规模训练中,训练时间会受到哪些因素的影响? 考察对注意力机制时间与空间复杂度的理解,以及对训练时间影响因素的分析能力第 13 题请介绍你对Transformer模型的理解,包括其核心机制和适用场景。 考察对Transformer架构核心组件、原理及应用的掌握程度第 14 题你知道哪些加速 Transformer 推理或训练的方法? 考察对 Transformer 加速手段的广度掌握第 15 题请说明 Transformer 与 RNN 在理论架构上的核心区别,以及这些区别在实际计算效率上的体现。 考察对 Transformer 与 RNN 架构差异及其计算特性的理解第 16 题请介绍 Self-Attention 机制的原理。 考察对注意力机制核心概念、计算流程与作用的理解第 17 题八股:多头和单头的情况下有什么区别? 考察对多头注意力机制原理、计算与效果差异的理解第 18 题请介绍Transformer中的位置编码,并重点说明旋转位置编码(RoPE)的原理与作用。 考察对Transformer位置编码机制及RoPE设计的理解第 19 题Transformer的normalization,为什么用LayerNorm不用其他的;介绍RMSNorm 考察对Transformer归一化机制的理解与归一化技术选型的权衡第 20 题Transformer中为何在softmax前将点积除以根号d? 考察对注意力机制缩放因子动机的理解