腾讯面试题 · Transformer
腾讯相关面试题,按最终去重题目聚合。
共 3056 道真题 · 当前筛选命中 26 道 · 更新 2026-08-05
筛选题目已选:Transformer
考察点
技术栈
第 1 题训练或推理 Transformer 模型时有哪些常用加速方式? 考察对模型计算优化方法的广度与原理理解第 2 题当输入的文本长度超出模型的上下文窗口时,目前有哪些主流的处理方案或模型架构来应对? 考察对超长文本处理技术的掌握程度和方案选型能力第 3 题请解释大语言模型的基本工作原理,包括预训练、微调和推理过程。 考察对大模型关键技术原理的理解和解释能力第 4 题如果只使用单头注意力,可能会在哪些方面受限? 考察对多头注意力机制价值与局限的理解第 5 题请介绍Transformer模型的核心结构及其各部分的作用。 考察对Transformer架构的基本理解与核心机制掌握第 6 题Transformer 中 Padding 的策略是什么? 考察对 Transformer 输入处理中 Padding 机制的理解第 7 题单头注意力在 Transformer 中有什么局限性? 考察单头注意力的表达瓶颈与多头优势的对比第 8 题介绍一下 Transformer 的基本原理。 考察对 Transformer 架构核心结构的理解第 9 题Transformer 中为什么使用 Layer Normalization(LN)而不是 Batch Normalization(BN)? 考察对 LN 与 BN 区别及在序列模型中的适用性的理解第 10 题请介绍Transformer的原理,并说明相比RNN和CNN的主要优势。 考察对Transformer核心机制的理解及其相对于传统序列模型的优势第 11 题Attention为什么要除以根号dk? 考察对Transformer中缩放点积注意力机制原理的理解第 12 题介绍一下 Transformer 的整体架构和核心组件。 考察对 Transformer 架构的理解与表达清晰度第 13 题Transformer 中 Decoder 与 Encoder 的主要区别是什么? 考察对 Encoder 与 Decoder 结构及作用差异的理解第 14 题请谈谈Transformer是如何实现并行化计算的。在计算注意力得分时,为什么通常要对点积结果进行缩放(即除以根号dk)? 考察Transformer并行计算原理及注意力机制中缩放因子的数学动机第 15 题请实现一个多头自注意力机制(Multi-Head Self-Attention)。 考察对Transformer核心组件的理解及编码实现能力第 16 题自然语言理解实现:请描述大模型中自然语言理解模块的具体实现方案,包括语义解析和意图识别的关键技术。 考察大模型在自然语言理解中的语义解析与意图识别技术实现第 17 题针对 Transformer 模型推理过程,您会采用哪些优化手段(如 KV Cache、算子融合等)?请说明原理及收益。 考察对 Transformer 推理加速技术的原理理解与工程实践能力第 18 题大模型实现的原理大概是怎样的? 考察对大语言模型核心原理的整体理解与表述能力第 19 题请介绍一下 BERT 的模型原理和核心特点。 考察对 BERT 预训练模型架构、训练任务及关键机制的理解第 20 题解释一下注意力机制,并举一个应用场景。 考察注意力机制的原理与落地理解