好未来面试题 · Transformer

好未来相关面试题,按最终去重题目聚合。

1380 道真题 · 当前筛选命中 11 · 更新 2026-08-05

筛选题目已选:Transformer
第 1 题Pre Norm 与 Post Norm 的区别是什么? 考察对 Transformer 归一化位置及其对训练稳定性和性能影响的理解技术原理方案权衡Transformer第 2 题在Transformer架构中,编码器(Encoder)和自注意力机制分别起到什么作用? 考察对Transformer核心组件作用的理解,以及模型内部信息处理机制的整体把握问题拆解技术原理Transformer第 3 题请描述 Llama 模型的整体架构,并说明其与早期 GPT 架构的主要区别。 考察对主流开源大模型架构的理解与细节掌握技术原理技术选型Transformer第 4 题请手写一个Transformer模型的核心代码,并解释关键组件的作用。 考察对Transformer架构的理解与编码实现能力编码实现技术原理Transformer第 5 题请解释Transformer解码器中past_key_value(或KV cache)的作用及其对推理性能的影响。 考察对Transformer自回归解码中KV缓存机制的深入理解性能优化技术原理Transformer第 6 题请说明 Transformer 中自注意力机制的核心原理,以及它与循环神经网络在处理长距离依赖上的差异。 考察对Transformer自注意力机制的理解及与RNN的对比能力问题拆解技术原理Transformer第 7 题请解释自注意力(self-attention)机制的工作原理,并说明其相对于循环神经网络的优势。 考察对 Transformer 核心机制的理解以及与传统序列模型的对比分析能力系统设计技术原理Transformer第 8 题GPT 模型在推理时,每一层的输入和输出分别是什么? 考察对 Transformer 解码器逐层前向传播中隐藏状态流动的理解技术原理Transformer第 9 题请说明 T5 模型与 BERT 在架构和预训练目标上的主要区别,并解释为什么在项目中可能选择 T5。 考察对两种主流预训练模型的架构设计与预训练任务差异的理解,以及结合项目背景进行技术选型的能力业务理解技术原理技术选型BERTTransformer第 10 题在Transformer的多头注意力机制中,缩放点积注意力为何要将点积结果除以sqrt(d_k)? 考察对注意力机制数值稳定性与概率分布的理解风险判断技术原理Transformer第 11 题请比较BERT和GPT在预训练目标上的区别,并说明这种区别对下游任务的影响。 考察对BERT和GPT架构及预训练方式的深入理解技术原理方案权衡BERTTransformer