人工智能面试题 · 问题拆解 · Transformer
人工智能相关岗位面试题。
共 11389 道真题 · 当前筛选命中 180 道 · 更新 2026-08-05
筛选题目已选:问题拆解 · Transformer
考察点
技术栈
第 141 题请简述一个将Transformer用于强化学习(RL)项目的基本思想,并结合你的项目经历谈谈其中的关键设计。 考察对Transformer在RL中应用原理的理解及项目实践细节第 142 题请说明自注意力机制的计算步骤。 考察对自注意力机制原理和计算流程的掌握第 143 题在典型Transformer模型中,Attention模块和MLP模块的参数规模通常哪个更大?请说明原因。 考察对Transformer结构参数分布的准确理解第 144 题请介绍BERT的模型结构及其核心组件。 考察对BERT架构的理解,包括Transformer层、注意力机制和预训练任务第 145 题多头注意力机制为什么要使用多个头? 考察对多头注意力机制设计动机和原理的理解第 146 题如果我更改了输入数据的量级,比如将输入的数据从长度100改成了1000,增加了10倍,Transformer的时间复杂度是会怎么变,参数量会怎么变? 考察Transformer模型对输入序列长度的计算复杂度与参数量理解第 147 题如果Transformer的注意力机制中把K去掉,变成QQV,会有什么问题? 考察对注意力机制中键(K)作用的理解,以及去掉K后带来的影响第 148 题为什么Attention有效? 考察对注意力机制原理和优势的深度理解第 149 题实习时你微调过Qwen2,请说说Qwen2的模型结构,以及相比Qwen1做了哪些改进? 考察对大语言模型结构演进的理解和对比分析能力第 150 题请讲解你读过的 Transformer 源码,并结合代码说明其核心模块。 考察对 Transformer 架构的理解深度与代码阅读能力第 151 题Transformer的注意力为什么要多个头,多个头为什么能注意到不同信息,为什么一个头不能呢,反正最终输出都是相同维度,难道一起就学不到分开的东西吗 考察多头注意力机制的设计动机与信息多样性第 152 题Transformer的并行计算能力体现在哪些方面? 考察对Transformer架构并行化原理的理解,包括注意力计算、层内模块和数据流第 153 题详细描述,如果给一个txt存储的文本,从预处理到SFT的训练流程,要包括对数据的预处理、tokenize、forward、loss计算、参数更新,越细越好。 考察大模型SFT全流程的技术细节与工程实现能力第 154 题推理时若图像尺寸不一致,切分 patch 后多出的 patch 应如何进行位置编码? 考察视觉 Transformer 中针对变长输入的位置编码处理策略第 155 题请概述自注意力机制从原始设计到现代优化的主要发展路线。 考察对Transformer核心机制演进脉络的理解与归纳能力第 156 题请写出 self-attention 的计算公式,并解释为什么要除以 sqrt(d_k)(即进行 scaling)。 考察对 Transformer 核心机制的理解及数值稳定性意识第 157 题请介绍DIN的注意力池化机制,并说明它与Transformer的self-attention有什么区别。 考察对DIN注意力机制的理解及与Transformer的对比第 158 题Transformer 中因果注意力和双向注意力的区别是什么? 考察对 Transformer 注意力机制在不同任务中应用差异的理解第 159 题请介绍 Transformer 的基本结构和核心机制,并说明它如何解决长距离依赖问题。 考察对 Transformer 核心组件和作用机制的理解第 160 题请解释Transformer架构,并说明为什么注意力机制能够有效工作。 考察对Transformer核心机制及注意力有效性原理的理解