美团面试题 · 方案权衡 · Transformer
美团相关面试题,按最终去重题目聚合。
共 3614 道真题 · 当前筛选命中 17 道 · 更新 2026-08-05
筛选题目已选:方案权衡 · Transformer
考察点
技术栈
第 1 题Qwen2.5-VL 中的 Transformer 结构与普通 Transformer 结构有哪些不同? 考察对现代 LLM 架构演进及视觉语言模型适配机制的理解第 2 题Transformer中的降维操作通常是如何进行的?请结合具体场景说明。 考察对Transformer中降维技术(如维度压缩、池化、投影)的理解与应用。第 3 题请介绍 Qwen2.5-VL 与普通 Transformer 在结构上的主要差异,并说明这些设计选择的目的。 考察多模态大模型的架构理解及设计权衡分析第 4 题Encoder中的self-attention和Decoder中的self-attention有什么区别? 考察对Transformer编码器与解码器注意力机制差异的理解第 5 题Transformer 为什么使用 LayerNorm 而不是 BatchNorm? 考察对归一化机制在序列建模中适用性的理解第 6 题你了解哪些 Transformer 的位置编码方式?它们分别有什么特点? 考察对位置编码常见方案及其设计动机的掌握第 7 题Transformer 模型中是如何处理梯度爆炸和梯度消失的? 考察对Transformer稳定训练机制的理解第 8 题既然decoder-only架构已经可行,为什么还需要encoder? 考察对Transformer架构各组件作用及不同任务场景下架构选择的理解第 9 题请解释 Decode-only 与 Encode-only 架构的区别,并说明各自的设计原因。 考察对自回归与编码器架构原理的理解及其设计动机第 10 题介绍Transformer的位置编码,为什么这么设计,为什么可以达到位置编码的效果,编码了相对位置还是绝对位置;介绍RoPE 考察位置编码原理、设计动机及RoPE的理解第 11 题请解释BERT模型的核心工作机制,并说明它相较于传统深度学习模型的主要优势。 考察对预训练语言模型原理的理解及与传统模型的对比能力第 12 题如何构建长序列模型来处理超长输入? 考察对长序列建模的架构设计与性能权衡第 13 题针对梯度爆炸和消失问题,近年有哪些新的改进方法或研究方向? 考察对深度学习训练稳定性的前沿了解第 14 题Transformer的normalization,为什么用LayerNorm不用其他的;介绍RMSNorm 考察对Transformer归一化机制的理解与归一化技术选型的权衡第 15 题请说明 RoPE 旋转位置编码的核心思想。 考察对 RoPE 原理及相对位置建模的理解第 16 题请介绍DIN的注意力池化机制,并说明它与Transformer的self-attention有什么区别。 考察对DIN注意力机制的理解及与Transformer的对比第 17 题BERT模型相较于Transformer架构的优化是什么? 考察对BERT核心创新及与Transformer基础架构差异的理解