人工智能面试题 · 方案权衡 · Transformer
人工智能相关岗位面试题。
共 11389 道真题 · 当前筛选命中 236 道 · 更新 2026-08-05
筛选题目已选:方案权衡 · Transformer
考察点
技术栈
第 41 题计算attention时为什么要除以根号dk,还有哪些scale处理? 考察对Transformer中注意力机制缩放因子的原理理解及变体知识第 42 题请比较CNN和Transformer在图像任务中的主要区别,并说明各自适用的场景。 考察对两种主流模型架构核心差异的理解及场景选择能力第 43 题图像数据通常如何处理位置编码? 考察对图像任务中位置信息建模的理解第 44 题UniAD的实现原理是什么?如何实现上层信息的聚合和传递? 考察对UniAD框架中多任务特征聚合与信息流动机制的理解第 45 题在Transformer框架下,CV、NLP、语音是否可能统一? 考察对Transformer跨模态统一潜力的理解和分析能力第 46 题有没有与基于Transformer的方法,如SegFormer、SegNeXt做过对比? 考察对方法对比实验的设计能力与结果解读深度第 47 题请说明 Self-Attention 的计算过程,并分析其优缺点。 考察对 Transformer 核心机制的理解以及权衡分析能力第 48 题旋转位置编码相比于传统正余弦位置编码的主要区别是什么? 考察对两类位置编码机制差异的理解第 49 题解释Transformer中除以根号$dk$的原因 考察对注意力机制数值稳定性和尺度问题的理解第 50 题嵌入层(Embedding Layer) 和 输出层(Output Layer) 是参数共享的吗? 考察对神经网络模型嵌入层与输出层参数共享机制的理解第 51 题目前的LLM结构和最开始的Transformers有哪些变化? 考察对Transformer架构演进及大模型技术迭代的理解第 52 题使用 KV Cache 之后,效果与改进前相比有什么变化?请分析。 考察对 KV Cache 作用、效果与代价的理解第 53 题MHA(多头注意力机制)的计算复杂度比较高,有哪些改进的方法? 考察Transformer注意力机制的计算瓶颈分析与优化方案设计第 54 题请比较BERT和GPT在模型结构与训练目标上的主要区别。 考察对编码器与解码器、双向与自回归生成差异的理解第 55 题分析RNN和Transformer各自的优缺点,并重点说明Transformer的并行性优势。 考察对两种序列模型架构的深入理解及并行计算差异第 56 题你了解哪些 Transformer 的位置编码方式?它们分别有什么特点? 考察对位置编码常见方案及其设计动机的掌握第 57 题ViT为什么要结合卷积或采用类似卷积的归纳偏置?请从Transformer和卷积的特性角度解释。 考察对Transformer序列建模与卷积局部性差异的理解第 58 题请介绍你对Transformer模型的理解,并结合你的实际业务,说明你做过哪些针对性的修改或优化? 考察对Transformer原理的理解深度和实际业务中的模型定制能力第 59 题CNN、Transformer的区别,分别更适合怎样的任务? 考察对两种主流深度学习架构原理差异与适用场景的理解第 60 题为什么现在 Decoder-only 成为大模型的主流架构? 考察对 Transformer 架构变体演进及大模型训练/推理权衡的理解