快手面试题 · Transformer
快手相关面试题,按最终去重题目聚合。
共 3254 道真题 · 当前筛选命中 53 道 · 更新 2026-08-05
筛选题目已选:Transformer
考察点
技术栈
第 21 题Transformer 的 Encoder 可以去掉 FFN(前馈网络)吗?为什么?是否可行? 考察对 Transformer 结构各组件作用及权衡的理解第 22 题为什么KV Cache对长上下文推理尤其关键? 考察对长上下文推理复杂度与缓存依赖的理解第 23 题在 DIN(Deep Interest Network)中,Attention 的计算方式与标准 Transformer 的 Attention 有何不同? 考察对 DIN 中局部激活单元(Attention 机制)的理解及其与 Transformer Attention 的对比第 24 题如何为多头注意力模块添加正则化或增强策略以提升训练稳定性? 考察模型训练的工程优化与设计能力第 25 题请解释Transformer中的attention机制的工作原理,并说明为什么需要multi-head attention。 考察对attention机制及其多头的原理理解第 26 题介绍Transformer结构,并说明各个部分的重要性。 考察对Transformer核心组件及其作用的理解深度第 27 题请介绍Transformer Decoder中的cross-attention机制,包括它的作用、计算流程以及与self-attention的区别。 考察对Transformer架构中cross-attention机制的理解与表达能力第 28 题请实现多头注意力机制的核心代码,并解释其结构。 考察多头注意力的实现细节与理解第 29 题请解释多头注意力机制(MHA)的基本原理和工作流程。 考察对Transformer核心组件多头注意力的理解第 30 题请介绍你了解的多模态大模型,并说明这类模型在架构上通常采用哪些做法来实现视觉与文本的联合建模。 考察候选人对多模态大模型发展趋势与主流技术路线的认知第 31 题我们现在是两阶段推荐架构:第一阶段召回用的是 embedding 点积召回,第二阶段是 MLP 跟 transformer 做多目标打分。那你觉得在我们这么大规模的数据量下,如果要做 real-time re-ranking,你会在架构上怎么做 trade-off?怎么压低 latency? 考察推荐系统实时重排架构的延迟与效果权衡能力第 32 题介绍Attention的计算,Self-Attention和Cross-Attention区别。 考察注意力机制的计算过程与两种注意力变体的理解第 33 题请讲解MHA、MQA、GQA和MLA的原理与区别,并说明各自的适用场景。 考察对注意力机制变体的理解深度及工程选型考量第 34 题请介绍 Self-Attention 机制的原理。 考察对注意力机制核心概念、计算流程与作用的理解第 35 题Prenorm和Postnorm是什么区别? 考察对Transformer及深度学习模型中归一化位置选择的理解第 36 题Transformer 是怎么把文本转成 token 并用于模型输入的?请描述完整的处理流程。 考察文本分词、词典映射和输入构造的完整流程第 37 题LLM中常用的激活函数有哪些? 考察对主流大语言模型架构中激活函数选型的理解第 38 题分析一下 DIN 的注意力机制和 Transformer 的注意力机制有什么不同。 考察对注意力机制的深入理解,辨析其在推荐系统与序列建模中的差异第 39 题请介绍 Transformer 的核心架构,并说明它相比传统序列模型的主要优势。 考察对 Transformer 整体架构和核心优势的理解第 40 题请解释多头注意力机制(MHA)的运行机制。 考察对Transformer核心组件多头注意力机制原理和结构的理解