LoRA中A矩阵初始化为高斯分布、B矩阵初始化为全零背后的设计原因是什么?如何理解用低秩参数表示Transformer大量参数的有效性?
考察说明
考察对低秩适配原理、初始化设计动机与参数高效微调本质的理解
回答思路
- 说明B初始为零可保证训练开始时增量矩阵为零,不破坏预训练权重
- 说明A使用高斯初始化配合B全零能避免对称性破坏且保证梯度可流动
- 解释低秩假设:预训练模型权重更新具有低秩性,可压至低维子空间
- 联系矩阵秩分解与参数量的数学关系,说明为什么少量参数能产生显著效果
本题已收录答题指导
本题附完整参考答案与评分标准
登录后可查看结构化答题指导;也可以直接开一场模拟面试,AI 面试官用本题实时追问并给出评分。