人工智能面试题更新 2026-08-05

请解释低秩适配(LoRA)的核心原理,并描述如何在实际模型微调流程中应用 LoRA 技术。

人工智能编码实现技术原理

考察说明

考查对 LoRA 原理的理解及在实际微调任务中的应用能力。

回答思路

  1. 【回答框架 1】LoRA 即低秩适配,是一种参数高效微调技术。核心思想是冻结预训练模型权重,通过引入低秩矩阵来近似权重更新量,只训练这些新增的少量参数,从而显著减少可训练参数量和显存占用。
  2. 【回答框架 2】具体做法:在原始权重矩阵 W 旁并行添加两个低秩矩阵 A 和 B,其中 A 的维度为 d×r,B 的维度为 r×k,r 远小于 min(d,k)。前向传播时,输出变为 h = Wx + (B×A)x,训练时只更新 A 和 B。
  3. 【回答框架 3】微调步骤:首先选择目标任务和数据集,加载预训练模型并冻结全部原始参数;其次在特定层(如注意力层的 Q、K、V、O 投影)插入 LoRA 模块,设置秩 r(常用 8 或 16)和缩放因子 alpha;然后按正常流程训练,设置合适的学习率(一般比全量微调稍高);最后合并权重(将 W 加上 B×A)或保留 LoRA 权重用于推理。
  4. 【回答框架 4】实际中常用 Hugging Face PEFT 库实现,通过配置 LoraConfig 指定目标模块和超参数,用 Trainer 训练。选择插入哪些层需要实验,通常插入所有线性层效果较好,但也可按需选择。
  5. 【关键点 1】LoRA 冻结原始权重,仅训练低秩矩阵,大幅减少可训练参数量。
  6. 【关键点 2】低秩分解假设权重更新具有低秩性,r 通常取 8 或 16。
  7. 【关键点 3】微调时需设置缩放因子 alpha,常用 alpha 为 r 的倍数。
  8. 【关键点 4】LoRA 属于 PEFT 方法,便于多任务切换和存储。
  9. 【易错点 1】过大的秩 r 会增加参数量,但过小可能表达能力不足,需要实验调整。
  10. 【易错点 2】将 LoRA 应用于所有层可能造成过拟合,应针对任务选择关键层。
  11. 【易错点 3】缩放因子设置不当会影响训练稳定性,应保持 alpha/r 常数以稳定学习率。