后端岗位面试题更新 2026-08-05

为什么 Self-Attention 中要对点积结果除以 sqrt(d_k) 做缩放?请解释其数学原理和实际作用。

寒武纪后端开发人工智能问题拆解技术原理Transformer

考察说明

考察对 Transformer 中注意力缩放机制原理的理解

回答思路

  1. 明确点积后数值分布与维度 d_k 的关系
  2. 解释方差随维度增长导致 softmax 梯度消失或饱和
  3. 说明缩放因子 sqrt(d_k) 的推导依据
  4. 结合 softmax 特性说明缩放对训练稳定性的意义
本题已收录答题指导

本题附完整参考答案与评分标准

登录后可查看结构化答题指导;也可以直接开一场模拟面试,AI 面试官用本题实时追问并给出评分。