后端岗位面试题更新 2026-08-05
为什么 Self-Attention 中要对点积结果除以 sqrt(d_k) 做缩放?请解释其数学原理和实际作用。
寒武纪后端开发人工智能问题拆解技术原理Transformer
考察说明
考察对 Transformer 中注意力缩放机制原理的理解
回答思路
- 明确点积后数值分布与维度 d_k 的关系
- 解释方差随维度增长导致 softmax 梯度消失或饱和
- 说明缩放因子 sqrt(d_k) 的推导依据
- 结合 softmax 特性说明缩放对训练稳定性的意义
本题附完整参考答案与评分标准
登录后可查看结构化答题指导;也可以直接开一场模拟面试,AI 面试官用本题实时追问并给出评分。