互联网/IT行业面试题 · Transformer
互联网/IT行业相关面试题,按题目行业基础数据聚合。
共 47588 道真题 · 当前筛选命中 348 道 · 更新 2026-08-05
筛选题目已选:Transformer
考察点
技术栈
第 121 题请介绍你对大模型推理中 KV Cache 的理解,包括它的作用、存储内容以及可能带来的问题。 考察对大模型推理优化核心机制的理解深度第 122 题你对大模型的结构、工作流有了解吗? 考察对大模型基础架构和核心工作流程的理解程度第 123 题请介绍你对Transformer模型的理解,并说明它是如何工作的。 考察对Transformer架构的掌握程度及知识深度第 124 题手写实现Transformer编码器中的多头注意力机制(MHA),并简要说明各步骤。 考察对Transformer编码器与多头注意力机制的理解及代码实现能力第 125 题请介绍Self-Attention机制的原理,以及它在大模型中的作用。 考察对注意力机制核心原理及其对模型能力贡献的理解第 126 题在Transformer框架下,CV、NLP、语音是否可能统一? 考察对Transformer跨模态统一潜力的理解和分析能力第 127 题在计算注意力分数时,为什么要除以根号 d_k? 考察对注意力缩放原因的理解第 128 题在Transformer中,多头注意力机制相比单头注意力有哪些优势?头数增加会如何影响算法复杂度? 考察对多头注意力机制原理及其计算复杂度的理解第 129 题Transformer 是怎么把文本转成 token 并用于模型输入的?请描述完整的处理流程。 考察文本分词、词典映射和输入构造的完整流程第 130 题请写出 Transformer 自注意力机制的计算公式,并简要解释每个符号的含义。 考察对 Transformer 自注意力机制的数学表达与符号理解第 131 题Attention为什么要除以根号dk? 考察对Transformer中缩放点积注意力机制原理的理解第 132 题请解释多头注意力机制(MHA)的基本原理和工作流程。 考察对Transformer核心组件多头注意力的理解第 133 题请介绍Transformer的整体结构,并说明其中关键组件的作用。 考察对Transformer架构及其核心机制的理解第 134 题dk是怎么确定的? 考察对模型维度与注意力头配置关系的理解第 135 题我们现在是两阶段推荐架构:第一阶段召回用的是 embedding 点积召回,第二阶段是 MLP 跟 transformer 做多目标打分。那你觉得在我们这么大规模的数据量下,如果要做 real-time re-ranking,你会在架构上怎么做 trade-off?怎么压低 latency? 考察推荐系统实时重排架构的延迟与效果权衡能力第 136 题介绍Transformer架构 考察对Transformer核心组件、设计动机和整体工作原理的理解第 137 题Transformer的Attention计算过程中为什么要对QK的点积进行scale? 考察对Attention机制中数值稳定性和Softmax梯度的理解第 138 题你了解哪些 Transformer 的位置编码方式?它们分别有什么特点? 考察对位置编码常见方案及其设计动机的掌握第 139 题请介绍 Self-Attention 机制的原理。 考察对注意力机制核心概念、计算流程与作用的理解第 140 题请描述GPT类decoder-only模型的工作流程和整体架构。 考察对生成式大模型架构和推理流程的理解