互联网/IT行业面试题 · Transformer
互联网/IT行业相关面试题,按题目行业基础数据聚合。
共 47588 道真题 · 当前筛选命中 348 道 · 更新 2026-08-05
筛选题目已选:Transformer
考察点
技术栈
第 281 题Transformer中的降维操作通常是如何进行的?请结合具体场景说明。 考察对Transformer中降维技术(如维度压缩、池化、投影)的理解与应用。第 282 题请解释 Transformer 中 Q、K、V 的原理及其在自注意力机制中的作用。 考察对自注意力机制及其 QKV 角色理解第 283 题在 Transformer 模型推理的 Attention 计算中,有哪些显存优化策略?请分别说明其思路和适用场景。 考察对大模型推理显存优化技术的理解深度与工程实践认知第 284 题请介绍 Transformer 的核心架构组成,并说明自注意力机制的原理。 考察对 Transformer 架构的理解深度与关键机制掌握第 285 题Transformer中的Q、K、V分别来自哪里?各自代表什么含义? 考察对Transformer自注意力机制中查询、键、值向量来源与作用的原理理解第 286 题多头注意力机制有哪些常见的改进方向?请举例说明。 考察对注意力机制变体的了解与对比能力第 287 题Transformer的forward计算包含哪些部件? 考察对Transformer前向计算组件的整体理解第 288 题如何为多头注意力模块添加正则化或增强策略以提升训练稳定性? 考察模型训练的工程优化与设计能力第 289 题Transformer的FFN层为什么会逐渐演变成MOE层? 考察对Transformer中FFN与稀疏专家路由演进逻辑的理解第 290 题请谈谈你对大模型底层原理的理解。 考察对大模型核心技术的理解深度与系统性第 291 题相比之下,Decoder-only相比Encoder-Decoder架构有哪些具体优势? 考察对两类架构差异的深入辨析能力第 292 题为什么Attention公式中要除以√dk?这个操作有什么作用? 考察对Transformer中缩放点积注意力原理的理解第 293 题请分析 Decoder-only 文本模型的结构特点,并说明其参数量主要由哪些部分组成。 考察对 Decoder-only 架构的理解及参数量估算能力第 294 题训练或推理 Transformer 模型时有哪些常用加速方式? 考察对模型计算优化方法的广度与原理理解第 295 题请解释Transformer中的位置编码的作用和实现方式。 考察对Transformer位置编码原理的理解及其在序列建模中的必要性第 296 题请介绍Transformer模型的核心结构及其各部分的作用。 考察对Transformer架构的基本理解与核心机制掌握第 297 题为什么需要位置编码?一个好的位置编码应具备哪些特性?请介绍主流的位置编码方法及其设计思路。 考察对Transformer位置编码必要性、设计原则及主流方案的掌握第 298 题为什么当前主流大型语言模型普遍采用Decoder-only架构? 考察对LLM架构选型背后工程与理论权衡的理解第 299 题Transformer的normalization,为什么用LayerNorm不用其他的;介绍RMSNorm 考察对Transformer归一化机制的理解与归一化技术选型的权衡第 300 题请介绍Transformer的整体结构及其各组成部分的作用。 考察对Transformer架构的深入理解与原理掌握