后端岗位面试题更新 2026-08-05
Transformer的自注意力机制是如何实现的?请说明Q、K、V的计算方式以及相关参数的初始化方法。
百度后端开发专业服务问题拆解技术原理Transformer
考察说明
考察对Transformer自注意力机制的理解深度,包括QKV计算流程和初始化细节
回答思路
- 准确描述Q、K、V的线性变换过程
- 说明注意力权重的计算(缩放点积)及softmax归一化
- 解释参数初始化(如Xavier/Glorot或He)及其原因
- 能结合具体实现(如PyTorch)说明初始化方式
本题附完整参考答案与评分标准
登录后可查看结构化答题指导;也可以直接开一场模拟面试,AI 面试官用本题实时追问并给出评分。