人工智能面试题更新 2026-08-05

能否解释一下 LoRA 的核心原理,包括低秩分解的动机、具体作用方式以及相比全参数微调的优势和局限?

人工智能技术原理方案权衡

考察说明

考查对大模型高效微调方法,特别是 LoRA 低秩适应原理的理解。

回答思路

  1. 【回答框架 1】LoRA 是一种参数高效的微调方法,核心思想是冻结预训练模型的权重,只在特定层(通常是注意力层的 Q、K、V、O 矩阵)引入低秩分解矩阵对增量进行建模。
  2. 【回答框架 2】其原理基于一个观察:模型微调后的权重变化矩阵通常具有较低的‘内在秩’,即变化主要集中在一个低维子空间。因此,将增量 ΔW 分解为两个低秩矩阵 A 和 B 的乘积,即 ΔW = A × B,其中 A 和 B 的秩远小于原始维度,从而大幅减少可训练参数。
  3. 【回答框架 3】在推理时,LoRA 可以将训练好的增量 ΔW 合并回原权重中(即 W' = W + α * A × B),不增加额外推理耗时;训练时,只优化 A 和 B,而原权重保持不变。
  4. 【回答框架 4】LoRA 的优势在于训练显存占用低、微调速度快、模型切换成本低(只需更换低秩矩阵);局限是并非所有层都适合低秩微调,且秩的选择(如 8、16、64)会影响效果,对某些知识密集型任务可能不如全参数微调效果好。
  5. 【关键点 1】LoRA 通过低秩分解 ΔW = A×B 减少训练参数,秩 r 远小于原始维度。
  6. 【关键点 2】冻结原权重,仅优化 A、B 矩阵,显著降低显存和内存消耗。
  7. 【关键点 3】推理时可合并权重,不增加额外计算延迟。
  8. 【易错点 1】不能将 LoRA 等同于全参数微调的完全替代,在某些任务上效果可能有差距。
  9. 【易错点 2】秩 r 的选取并非固定,需要根据任务和模型规模进行实验调整。