人工智能面试题 · 风险判断 · Transformer

人工智能相关岗位面试题。

11389 道真题 · 当前筛选命中 11 · 更新 2026-08-05

筛选题目已选:风险判断 · Transformer
第 1 题注意力公式中为什么要除以根号d? 考察对自注意力机制缩放因子原理的理解风险判断技术原理Transformer第 2 题请介绍对编码模型(如代码生成模型)的了解,包括原理和优缺点。 考察对代码生成模型原理及局限的认知风险判断技术原理LLMTransformer第 3 题Transformer训练过程中为什么容易出现梯度消失或爆炸问题? 考察对Transformer训练稳定性的原理理解和优化手段风险判断技术原理Transformer第 4 题请对比主流大模型架构(如Transformer、MoE等)的差异,并说明各自适用的业务场景。 考察对大模型架构差异的理解及场景适配能力风险判断技术原理技术选型Transformer第 5 题Transformer中自注意力公式除以根号d的作用是什么?是缓解梯度爆炸还是梯度消失? 理解注意力缩放因子的数学目的及其对梯度的影响风险判断技术原理Transformer第 6 题是否有Attention极化现象,如何应对? 考察对Transformer中注意力分布极化问题的理解与应对策略风险判断技术原理方案权衡Transformer第 7 题Transformer的Decoder为什么要用掩码? 考察对自回归解码与因果掩码原理的理解风险判断技术原理Transformer第 8 题在Transformer的多头注意力机制中,缩放点积注意力为何要将点积结果除以sqrt(d_k)? 考察对注意力机制数值稳定性与概率分布的理解风险判断技术原理Transformer第 9 题RoPE 旋转位置编码是如何运作的?为什么它适合长文本? 考察对 RoPE 数学原理及其长文本外推优势的理解风险判断技术原理Transformer第 10 题请解释 Layer Normalization(LN)的作用及其在 Transformer 中的应用。 考察对 LN 原理与作用位置的理解风险判断技术原理Transformer第 11 题从理论上看,LLaMA 模型对于输入句子的长度是否存在无上限的可能?请说明其根本限制因素。 考查对 Transformer 模型上下文长度限制根源的理解,以及位置编码的作用。风险判断技术原理Transformer