BERT中,一个batch的输入需要padding,在attention时如何处理padding位置?
考察说明
考察Transformer/BERT中padding mask的实现原理及作用
回答思路
- 说明padding mask的作用是避免模型关注无效的padding token
- 解释在计算attention score前如何将padding位置置为极大负值(或零)
- 能区分attention mask与token type id、segment id的区别
- 能结合softmax计算说明mask后概率分布的效果
本题已收录答题指导
本题附完整参考答案与评分标准
登录后可查看结构化答题指导;也可以直接开一场模拟面试,AI 面试官用本题实时追问并给出评分。