阿里云面试题 · 技术原理 · Transformer
阿里云相关面试题,按最终去重题目聚合。
共 2357 道真题 · 当前筛选命中 16 道 · 更新 2026-08-05
筛选题目已选:技术原理 · Transformer
考察点
技术栈
第 1 题在Transformer中为什么要使用位置编码?为什么常采用正弦余弦(sin/cos)函数形式? 考察对Transformer位置信息建模原理及sin/cos编码设计动机的理解第 2 题除了标准多头注意力(MHA)之外,你还了解哪些注意力机制(如 GQA、MQA、MLA)?请讲解其原理。 考察对高效注意力变体的原理理解,包括参数共享、KV缓存和推理效率第 3 题Attention中为什么要除以根号dk? 考察对注意力机制数学原理和数值稳定性的理解第 4 题请详细介绍一下Transformer的整体结构及其核心组件的作用。 考察对Transformer架构各组成部分的理解及其设计动机第 5 题请介绍你对 Transformer 架构的理解。 考察对 Transformer 架构核心组件和工作原理的掌握程度第 6 题旋转位置编码相比于传统正余弦位置编码的主要区别是什么? 考察对两类位置编码机制差异的理解第 7 题请介绍你对 Transformer 架构的理解,包括其核心组件和自注意力机制的作用。 考察对 Transformer 架构核心原理的理解深度第 8 题请介绍Transformer的核心组件,并说明每个组件的作用。 考察对Transformer架构关键模块及其功能的理解第 9 题请介绍LLM的Decoder-Only架构,并说明其关键组成部分。 考察对Decoder-Only架构的基本原理、结构组成及核心概念的理解第 10 题KV-Cache如何加速推理? 考察对Transformer推理中KV缓存机制及其加速原理的理解第 11 题请介绍大模型常用的位置编码方式有哪些? 考察对Transformer位置编码基本类型的掌握第 12 题请介绍你对大模型(Large Language Model)的了解,并解释什么是大模型。 考察基础知识掌握程度与概念表达能力第 13 题请简述你对大语言模型基本原理的了解,包括其训练和推理的核心流程。 考察对大语言模型整体架构和运行机制的理解深度第 14 题为什么Transformer中前馈网络FFN的隐藏维度通常是输入维度的4倍(d到4d)? 考察对Transformer架构设计动机和参数权衡的理解第 15 题Transformer的FFN层能不能去掉,为什么? 考察对Transformer架构中FFN层作用及必要性的深入理解第 16 题多模态大模型中的ViT,解释其原理以及它是如何训练的? 考察对Vision Transformer(ViT)架构原理及其训练流程的理解