互联网/IT行业面试题 · 编码实现 · Transformer
互联网/IT行业相关面试题,按题目行业基础数据聚合。
共 47588 道真题 · 当前筛选命中 26 道 · 更新 2026-08-05
筛选题目已选:编码实现 · Transformer
考察点
技术栈
第 1 题请手写一个Transformer的Decoder Block核心实现。 考察对Transformer解码器结构、核心算子和实现细节的掌握第 2 题请手写实现Transformer Decoder层,并说明如何实现mask机制以支持自回归生成。 考察对Transformer Decoder结构、自注意力mask和因果掩码的实现能力第 3 题请手写正余弦位置编码的公式,并简要说明其设计思路。 考察对Transformer位置编码原理的掌握与推导能力第 4 题假设让你用 BERT 或 Transformer 搭建一个文本分类模型,你会如何快速完成?请描述从准备到训练的关键步骤。 考察对预训练模型微调的流程熟悉度及工程实践能力第 5 题请实现多头注意力机制的核心代码,并解释其结构。 考察多头注意力的实现细节与理解第 6 题请手写实现一个 Transformer Encoder 的核心结构。 考察对 Transformer Encoder 的结构理解与代码实现能力第 7 题请描述一个 prompt 从输入到输出完整经过 Transformer 的处理流程。 考察对 Transformer 架构从输入嵌入到输出生成的端到端理解第 8 题请手写Transformer的核心结构,并解释各模块的作用。 考察对Transformer架构细节的理解和编码实现能力第 9 题请说明旋转位置编码(RoPE)的实现方式及其优势。 考察对旋转位置编码具体实现和设计动机的理解第 10 题Transformer中带Mask的Attention是如何实现的? 考察掩码机制的原理与实现方式第 11 题用BERT做分类时,softmax应该添加在哪个层级,维度如何选择? 考察BERT分类头的实现细节与输出维度设计第 12 题代码题:实现 Casual mask 的 MHA,并说明其计算复杂度。 考察注意力机制实现细节、因果掩码原理与复杂度分析第 13 题手写实现Transformer编码器中的多头注意力机制(MHA),并简要说明各步骤。 考察对Transformer编码器与多头注意力机制的理解及代码实现能力第 14 题Transformer 是怎么把文本转成 token 并用于模型输入的?请描述完整的处理流程。 考察文本分词、词典映射和输入构造的完整流程第 15 题请手写并讲解 Transformer Encoder 的核心实现,包括多头注意力、前馈网络、残差连接与层归一化。 考察对 Transformer Encoder 结构、注意力计算细节及实现的掌握程度第 16 题谈谈你对Transformer架构的理解,以及它的实现方式? 考察对Transformer核心组件、原理及工程实现的掌握程度第 17 题请具体说明在Transformer中如何实现多头注意力机制(Multi-Head Attention)。 考察对注意力机制实现细节的理解,包括Q/K/V投影、缩放点积和拼接输出第 18 题手写自注意力机制,并说明Q、K、V的线性变换矩阵能否共享权重? 考察自注意力机制的编码实现与对QKV投影空间的理解第 19 题详细描述,如果给一个txt存储的文本,从预处理到SFT的训练流程,要包括对数据的预处理、tokenize、forward、loss计算、参数更新,越细越好。 考察大模型SFT全流程的技术细节与工程实现能力第 20 题解码器的输出形状是什么,如何做自回归过程? 考察对自回归生成流程和存储结构的理解