人工智能面试题更新 2026-08-05

BERT中,一个batch的输入需要padding,在attention时如何处理padding位置?

金山WPS人工智能问题拆解技术原理BERTTransformer

考察说明

考察Transformer/BERT中padding mask的实现原理及作用

回答思路

  1. 说明padding mask的作用是避免模型关注无效的padding token
  2. 解释在计算attention score前如何将padding位置置为极大负值(或零)
  3. 能区分attention mask与token type id、segment id的区别
  4. 能结合softmax计算说明mask后概率分布的效果
本题已收录答题指导

本题附完整参考答案与评分标准

登录后可查看结构化答题指导;也可以直接开一场模拟面试,AI 面试官用本题实时追问并给出评分。