互联网/IT行业面试题 · Transformer
互联网/IT行业相关面试题,按题目行业基础数据聚合。
共 47588 道真题 · 当前筛选命中 348 道 · 更新 2026-08-05
筛选题目已选:Transformer
考察点
技术栈
第 321 题Qwen2.5-VL 中的 Transformer 结构与普通 Transformer 结构有哪些不同? 考察对现代 LLM 架构演进及视觉语言模型适配机制的理解第 322 题说一下Attention是怎么做的,Encoder和Decoder的Attention一样吗? 考察对Attention机制原理及Encoder-Decoder中差异的理解第 323 题请介绍BERT模型的结构和核心原理。 考察对预训练模型架构与训练机制的理解深度第 324 题CLIP 中文本编码器的结构是什么样的,输入输出是什么? 考察对 CLIP 模型架构细节的理解以及多模态模型中文本分支的处理方式第 325 题transformer的 attention 中的 QKV 是一样的吗? 考察注意力机制中 Q、K、V 的角色和来源第 326 题三角函数位置编码有哪些好处?旋转位置编码相比它有什么优势? 考察位置编码的设计动机与在长序列、相对位置建模上的差异第 327 题请在白板/代码中实现Transformer的Decoder Block(含Masked Self-Attention与Cross-Attention)。 考察对Transformer Decoder结构、子层顺序及掩码细节的掌握与编码能力第 328 题你了解大模型的基本原理吗?请简要介绍你熟悉的大模型架构和核心概念。 考察对大模型基础知识和核心概念的掌握程度第 329 题Transformer架构为什么要切分为多头? 考察对多头注意力机制设计动机与效果的理解第 330 题为什么Transformer模型要采用多头注意力机制而不是单头注意力? 考察对多头注意力机制设计动机与效果的理解第 331 题介绍Attention的计算,Self-Attention和Cross-Attention区别。 考察注意力机制的计算过程与两种注意力变体的理解第 332 题请解释 Encoder、Decoder 和 Decoder-only 架构的区别。 考察对 Transformer 三种主要架构形态及其适用场景的理解第 333 题请对比主流大模型架构(如Transformer、MoE等)的差异,并说明各自适用的业务场景。 考察对大模型架构差异的理解及场景适配能力第 334 题什么是 KV Cache?它在 Transformer 推理中扮演什么角色? 考察对 Transformer 自回归解码中键值缓存机制的理解第 335 题讲讲MHA、Attention公式,为什么需要除以根号 dk。 考察对Transformer核心组件及缩放点积注意力原理的掌握第 336 题Transformer中Encoder和Decoder的区别和联系,以及如果单独分开使用的话,各自的优缺点是什么? 考察对Transformer架构的理解、模块职责划分及独立使用的适用场景分析第 337 题请详细说明Transformer中Attention机制的q、k、v分别代表什么,以及它们如何通过计算得到最终输出,其中Softmax起到什么作用? 考察对注意力机制核心原理、计算流程及Softmax作用的理解第 338 题请解释KV Cache在Transformer推理中的原理及其作用。 考察对Transformer推理优化中KV Cache机制的理解第 339 题请详细讲解Transformer架构的整体工作流程,包括从输入到输出的主要步骤。 考察对Transformer整体流程的清晰理解与关键机制掌握第 340 题请详细解释 Transformer 解码器的结构及其工作原理。 考察对 Transformer 解码器核心机制的理解