美团面试题 · Transformer
美团相关面试题,按最终去重题目聚合。
共 3614 道真题 · 当前筛选命中 56 道 · 更新 2026-08-05
筛选题目已选:Transformer
考察点
技术栈
第 41 题如何构建长序列模型来处理超长输入? 考察对长序列建模的架构设计与性能权衡第 42 题RoPE 旋转位置编码的核心思想是什么? 考察对 RoPE 设计原理、数学形式及优点的深入理解第 43 题针对梯度爆炸和消失问题,近年有哪些新的改进方法或研究方向? 考察对深度学习训练稳定性的前沿了解第 44 题介绍一下Transformer的结构? 考察对Transformer核心组件的理解与整体架构掌握第 45 题请详细讲解Transformer架构的整体工作流程,包括从输入到输出的主要步骤。 考察对Transformer整体流程的清晰理解与关键机制掌握第 46 题训练过程中 Transformer 更新哪些参数? 考察对 Transformer 模型训练时参数更新范围的掌握第 47 题Transformer的normalization,为什么用LayerNorm不用其他的;介绍RMSNorm 考察对Transformer归一化机制的理解与归一化技术选型的权衡第 48 题请介绍Transformer模型中编码器(Encoder)和解码器(Decoder)的结构与各自作用,并说明它们之间的区别。 考察对Transformer核心组件结构与功能差异的理解第 49 题请说明 RoPE 旋转位置编码的核心思想。 考察对 RoPE 原理及相对位置建模的理解第 50 题DeepSeek 用的 MLA(Multi-head Latent Attention)注意力机制是如何实现的? 考察对 MLA 压缩注意力机制原理的理解第 51 题请解释Transformer中的自注意力机制,包括其计算过程和意义。 考察对自注意力数学原理和功能作用的理解。第 52 题请介绍DIN的注意力池化机制,并说明它与Transformer的self-attention有什么区别。 考察对DIN注意力机制的理解及与Transformer的对比第 53 题BERT模型相较于Transformer架构的优化是什么? 考察对BERT核心创新及与Transformer基础架构差异的理解第 54 题请介绍BERT模型的结构和核心原理。 考察对预训练模型架构与训练机制的理解深度第 55 题Mask Attention是怎么做的? 考察对Transformer中Masked Attention机制的理解,包括实现原理和不同应用场景第 56 题LLM和NLP有什么关系? 考察对LLM与NLP学科基础和演进关系的理解