序列中每个token的embedding经过多层self-attention后变得越来越相似,原因是什么?
考察说明
考察对Transformer中self-attention各层表征退化和各向异性现象的理解
回答思路
- 能说明self-attention加权平均导致的表示平滑效应
- 能解释多层堆叠后表示趋于一致(过度平滑)的机制
- 能提及与残差连接、层归一化的关系
- 能指出缓解手段如缩放点积注意力、层数控制或对比学习等
考察对Transformer中self-attention各层表征退化和各向异性现象的理解