【AI大模型面试】LoRA和全量微调有何不同?被问了不下5遍

发布时间:2026/8/27 14:16:02
【AI大模型面试】LoRA和全量微调有何不同?被问了不下5遍 前言本文旨在了解两种微调大型语言模型方法之间的差异完全微调和低秩自适应 (LoRA)。这两种方法都用于将预训练模型适应特定的下游任务但它们却有所不同。微调Fine-tuning是将经过预训练的大语言模型应用于下游任务的关键范例。最近低秩自适应 (LoRA) 等方法已被证明可以在各种任务上达到完全微调模型的性能同时可训练参数的数量却大大减少。这就提出一个问题即它们学到的解决方案真的等效吗带着这一疑问来自 MIT 的研究者在论文《 LORA VS FULL FINE-TUNING: AN ILLUSION OF EQUIVALENCE 》中进行了深入探讨。论文地址https://arxiv.org/pdf/2410.21228v1作者通过分析预训练模型权重矩阵的光谱特性来研究不同的微调方法如何改变模型。研究发现完全微调与 LoRA 产生的权重矩阵奇异值分解结构有显著不同并且经过微调后的模型在面对超出适应任务分布的测试时也显示出不同的泛化行为。特别是LoRA 训练的权重矩阵中出现了称为「侵入维度intruder dimensions」的新的高秩奇异向量而在完全微调中则不会出现这种情况。这些结果表明即使在微调分布上表现相同但使用 LoRA 和完全微调更新的模型访问参数空间的不同部分。作者通过研究 LoRA 微调模型中出现侵入维度的原因、它们为什么不受欢迎以及如何最小化这些效果来展开研究。最后作者给出了以下几点观察首先LoRA 和完全微调在结构上产生不同的参数更新这种差异由侵入维度的存在产生的。这些侵入维度是奇异向量具有较大的奇异值并且与预训练权重矩阵中的奇异向量近似正交。相比之下完全微调模型在光谱上与预训练模型保持相似不包含侵入维度。其次从行为上看与完全微调相比具有侵入维度的 LoRA 微调模型会忘记更多的预训练分布并且表现出较差的稳健连续学习能力具有侵入维度的 LoRA 微调模型在适应任务分布之外不如完全微调模型尽管分布准确度相当。最后即使在目标任务上低秩 LoRA 表现良好但更高秩的参数化可能仍然是可取的。低秩 LoRAr ≤ 8适合下游任务分布完全微调和高秩 LoRAr 64让模型泛化能力更强、自适应能力更加鲁棒。然而为了利用更高的秩LoRA 更新模型必须是秩稳定的。沃顿商学院副教授 Ethan Mollick 对此评论道事实证明使用 LoRA 定制通用 LLMApple 调优其设备内置模型的方式对 LLM 的限制远大于微调因为它们失去了一些泛化能力。原因是 LoRA 增加了不祥的侵入维度。1、LORA 和完全微调模型的差异本文采用神经网络参数的奇异值分解 SVD 来理解微调对预训练权值的变化。特别是本文测量了用 LoRA 微调过的权重矩阵中的奇异向量或完全微调过的权重矩阵中奇异向量映射到预训练权重中的奇异向量的程度使用它们的余弦相似性。这些关系如图 1 和图 3 所示颜色表示预训练和微调奇异向量之间的余弦相似度。图 2 (b) 中观察到LoRA 和完全微调的奇异向量与预训练奇异向量的相似度非常不同与完全微调相比使用 LoRA 微调的模型的奇异向量与预训练奇异向量的平均余弦相似度似乎要低得多。图 2 (b) 中左下角有一个唯一的红点作者将这些新维度命名为侵入维度其正式定义如下LoRA 微调模型包含高秩侵入维度而完全微调的模型则不包含。为了量化特定权重矩阵的侵入维度集的大小作者使用图 4 所示的算法。即使在 LoRA 微调模型学习效果不如完全微调的任务中侵入维度也存在。观察图 5b、5c 和 5d我们可以清楚地看到即使 LoRA 的 r256高秩奇异向量集中仍出现侵入维度。重要的是当 r2048 时没有侵入维度而是展示了与完全微调非常相似的曲线。这支持了早先的发现随着秩增加超过一个阈值侵入维度会消失LoRA 开始趋向于与完全微调相似。即使使用满秩矩阵执行 LoRA完全微调更新也比 LoRA 更新具有更高的有效秩。如图 6 所示可以观察到完全微调解决方案的有效秩明显高于通过 LoRA 学习到的解决方案的有效秩即使 LoRA 具有更高的秩。2、LORA 和完全微调之间的行为差异在较低秩LoRA 在持续学习过程中的适应能力较差会忘记更多之前的任务。该研究在多个任务上按顺序训练 RoBERTa并测量学习新任务时性能的变化程度。该研究使用与之前相同的训练方案、数据集但在持续学习环境中使用以下数据集按顺序进行微调MNLI、QQP、SST-2、SIQA、Winogrande、FEVER。在序列中某个数据集上进行训练后将 LoRA 权重合并到模型中并在下一个任务训练之前重新初始化以便不受之前任务的影响。在对特定任务进行训练后该研究对所有任务进行测试对于每个任务在测试测试集之前分别重新训练分类头。这能够检查模型在这些任务上表现如何而无需实际更改模型本身。结果如图 8 所示。虽然 LoRA 最初与完全微调的性能相当但较小的 LoRA 秩在持续学习过程中始终表现出更大的性能下降。特别是对于前三个训练数据集当 r 1 时 LoRA 的性能下降到预训练基线以下。随着 LoRA 秩的提高我们可以看到这种遗忘行为减少并且更接近于完全微调甚至在完成持续学习后在 MNLI 上的遗忘也更少。整体情况是微妙的虽然在某些情况下LoRA 似乎忘记得较少但对于某些任务以及某些秩事实上LoRA 可能会忘记更多。对于微调到等效测试精度的 LoRA 模型可以看到一条 U 形曲线该曲线标识了适合下游任务的最佳等级同时最小程度的忘记了预训练分布。图 9 报告了测量的伪损失分数。可以看到完全微调和 r 768 时的 LoRA 之间呈现 U 形趋势。相对于完全微调低秩r 1和高秩r 768都会导致预训练分布的遗忘更大而对于 r 64遗忘较少。也就是说当 r 1 时使用 LoRA 微调的模型受到侵入维度的影响并且似乎比没有侵入维度的 r 64 有更多的遗忘。然而当 r 768 时使用 LoRA 微调的模型也表现出更糟糕的遗忘这表明由于过度参数化它们对适应任务过度拟合。当 r 8 和 r 64 时遗忘量少于完全微调。最后的最后感谢你们的阅读和喜欢作为一位在一线互联网行业奋斗多年的老兵我深知在这个瞬息万变的技术领域中持续学习和进步的重要性。为了帮助更多热爱技术、渴望成长的朋友我特别整理了一份涵盖大模型领域的宝贵资料集。这些资料不仅是我多年积累的心血结晶也是我在行业一线实战经验的总结。这些学习资料不仅深入浅出而且非常实用让大家系统而高效地掌握AI大模型的各个知识点。如果你愿意花时间沉下心来学习相信它们一定能为你提供实质性的帮助。这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】大模型知识脑图为了成为更好的 AI大模型 开发者这里为大家提供了总的路线图。它的用处就在于你可以按照上面的知识点去找对应的学习资源保证自己学得较为全面。经典书籍阅读阅读AI大模型经典书籍可以帮助读者提高技术水平开拓视野掌握核心技术提高解决问题的能力同时也可以借鉴他人的经验。对于想要深入学习AI大模型开发的读者来说阅读经典书籍是非常有必要的。实战案例光学理论是没用的要学会跟着一起敲要动手实操才能将自己的所学运用到实际当中去这时候可以搞点实战案例来学习。面试资料我们学习AI大模型必然是想找到高薪的工作下面这些面试题都是总结当前最新、最热、最高频的面试题并且每道题都有详细的答案面试前刷完这套面试题资料小小offer不在话下640套AI大模型报告合集这套包含640份报告的合集涵盖了AI大模型的理论研究、技术实现、行业应用等多个方面。无论您是科研人员、工程师还是对AI大模型感兴趣的爱好者这套报告合集都将为您提供宝贵的信息和启示。这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】