后端岗位面试题更新 2026-08-05

Transformer的自注意力机制是如何实现的?请说明Q、K、V的计算方式以及相关参数的初始化方法。

百度后端开发专业服务问题拆解技术原理Transformer

考察说明

考察对Transformer自注意力机制的理解深度,包括QKV计算流程和初始化细节

回答思路

  1. 准确描述Q、K、V的线性变换过程
  2. 说明注意力权重的计算(缩放点积)及softmax归一化
  3. 解释参数初始化(如Xavier/Glorot或He)及其原因
  4. 能结合具体实现(如PyTorch)说明初始化方式
本题已收录答题指导

本题附完整参考答案与评分标准

登录后可查看结构化答题指导;也可以直接开一场模拟面试,AI 面试官用本题实时追问并给出评分。