互联网/IT行业面试题 · 技术选型 · Transformer
互联网/IT行业相关面试题,按题目行业基础数据聚合。
共 47588 道真题 · 当前筛选命中 56 道 · 更新 2026-08-05
筛选题目已选:技术选型 · Transformer
考察点
技术栈
第 1 题请介绍位置编码的原理与作用。 考察对序列建模中位置信息处理的理解第 2 题为什么Tiger模型采用encoder-decoder架构而不是decoder-only架构? 考察对Transformer架构设计权衡和模型选型的理解第 3 题我们这个岗位对大模型底层和代码等也有一定要求,谈谈你的认识和理解,知道多少? 考察对大模型底层原理的认知深度与代码实践能力第 4 题为什么BERT时代没有出现scaling law? 考察对规模法则前提、历史背景和架构差异的理解第 5 题请说明 BERT 的模型结构,并对比它与传统文本编码器(如 RNN、LSTM)的优势。 考察对 BERT 架构原理的理解及与传统编码器的对比分析能力第 6 题你使用的是什么Embedding模型结构?它的输出向量维度是多少? 考察候选人对Embedding模型结构与向量维度等基础技术细节的理解第 7 题BERT和Transformer的区别是什么? 考察对模型架构演进和预训练任务的理解第 8 题在多头注意力中,存在哪些常见的变体?如何设计新的变体? 考察对注意力机制变体的了解与设计思考第 9 题经典的微调算法有哪些? 考察对预训练模型常见微调范式的理解和区分能力第 10 题除 Decoder-only 外,Transformer 的 Encoder-only 与 Encoder-Decoder 架构分别适合什么任务? 考察对 Transformer 变体任务适配的理解第 11 题你了解 Transformer 或 Attention 机制的其他变体或改进吗? 考察对Attention机制及Transformer架构的深入理解与扩展知识第 12 题position embedding 和 input 是怎么融合的? 考察对 Transformer 中位置编码与输入表征融合方式的理解第 13 题FFN(前馈神经网络)为什么要先升维再降维? 考察对Transformer中前馈网络结构设计的理解及直觉第 14 题后来有哪些比较经典的基于Transformer的语言模型,Qwen相比于原始Transformer有哪些结构上的改动,Qwen2又有哪些改进? 考察对Transformer架构演进、Qwen系列模型结构差异及版本改进的理解第 15 题Attention机制有哪些常见类型?位置编码有哪些常见方式? 考察对Transformer核心组件Attention机制和位置编码的分类与原理理解第 16 题请详细介绍一下Transformer的整体结构及其核心组件的作用。 考察对Transformer架构各组成部分的理解及其设计动机第 17 题请详细解释BERT模型的结构原理、主要缺点及其改进模型。 考察对BERT预训练模型原理的深入理解、局限性的把握以及相关改进工作的了解第 18 题请介绍除 DIN 之外的序列建模方法,并对比 Transformer 与 DIN 在推荐场景中的区别。 考察序列建模技术积累与推荐场景下的模型选型能力第 19 题请介绍Transformer模型中的主要计算过程,包括自注意力机制和前馈网络的计算步骤。 考察对Transformer核心计算流程的理解,包括自注意力的矩阵运算、多头机制及前馈网络第 20 题请解释BERT模型的核心工作机制,并说明它相较于传统深度学习模型的主要优势。 考察对预训练语言模型原理的理解及与传统模型的对比能力