ARTICLE DETAIL

资讯详情

深耕编程入门与网站建设的一线实战洞察。

【每日搜索】2026.6.19

【每日搜索】2026.6.19 1.LoRA低秩适配微调知识点梳理1. 类别重参数化 PEFT 方法PEFT参数高效微调不用完整训练整个大模型降低显存、算力开销。核心思想不对预训练模型原始参数W做更新对模型参数做变换 / 重表示新增少量可训练参数减少训练成本提升训练效率。代表LoRA(Low‑Rank Adaptation)工业界最常用 PEFT 方案。2. Full Fine‑tuning全量微调图 a输入x预训练权重矩阵\(W\in\mathbb R^{m\times n}\)输出\(y Wx\) ✅做法把整个预训练矩阵W全部参与训练更新 ❌缺点参数量巨大需要极大显存每个任务都要保存一份完整大模型权重存储开销大。3. LoRA 原理图 b在原有权重W旁增加旁路分支不改动原始预训练矩阵W冻结W不训练。新增两个低秩矩阵A、B秩为r\(r\ll m,n\)秩远小于原始矩阵维度参数量很小初始化B初始化为0矩阵A用高斯分布\(A\sim N(0,\sigma^2)\)初始化前向计算\(y Wx\frac{\alpha}{r}BAx\)旁路流程输入x先过矩阵A做降维再过矩阵B做升维最后和主干Wx相加融合。\(\alpha\)是缩放超参数。训练 推理特点训练阶段只训练\(A、B\)原始大模型W完全冻结训练参数量极少显存占用低。推理阶段可以把\(\frac{\alpha}{r}BA\)直接加到原始权重W上得到合并后的权重 \(WW\frac{\alpha}{r}BA\)推理和原始模型速度完全一样没有额外推理延迟。4. LoRA 优缺点✅优点训练参数量小训练成本低推理无额外开销可以合并权重不会破坏预训练模型原有知识不同任务可以保存多套小的 LoRA 权重按需加载。❌缺点秩r需要调参任务复杂时需要调高 r一般作用于 Transformer 的 Attention 层FFN 层效果不一定好。对比记忆表格方式是否更新原始大权重可训练参数量推理速度全量微调 Full FT更新全部巨大正常LoRA冻结原始权重只训 A、B很小正常可合并权重一句话理解 LoRA冻结大模型主干搭一个小的低秩旁路做降维‑升维学习任务增量训练小参数推理无代价。2. LoRA 低秩适配 深度详解LoRALow‑Rank Adaptation低秩适配属于PEFT 参数高效微调里的重参数化流派。PEFT 的目标大预训练模型 PLM 参数动辄几十亿‑上千亿全量微调显存、算力成本极高。PEFT 不去更新全部模型权重只训练少量新增参数达到接近全量微调效果。一、先回顾全量微调 Full Fine‑Tuning图 (a) 输入向量 x预训练权重矩阵 \(W\in \mathbb R^{m\times n}\)\(y Wx\)训练反向传播更新整个矩阵 W 的全部参数。问题大模型矩阵 W 参数量极大训练需要很大显存每一个下游任务都要保存一份完整的大模型权重存储成本爆炸容易发生灾难性遗忘把预训练学到的通用知识训坏。理想预训练的 W 已经学到海量通用知识我们不需要把它改掉只学习 “任务需要的增量变化”。LoRA 就是做这件事。二、LoRA 核心数学原理1. 权重更新的低秩假设全量微调时权重的更新量记为 \(\Delta W\)微调后权重\(W_{new}W\Delta W\)LoRA 的核心假设下游任务带来的权重更新量 \(\Delta W\) 是低秩的。 也就是说巨大的矩阵 \(\Delta W_{m\times n}\)可以分解成两个小矩阵相乘\(\Delta W \approx BA\)\(B\in\mathbb R^{m\times r}\)\(A\in\mathbb R^{r\times n}\)\(\boldsymbol{r\ll \min(m,n)}\)r 是 LoRA 秩超参数一般取 8,16,32。原来\(\Delta W\)参数量 \(m\times n\)分解后\(A、B\)总参数量\(r(mn)\)。r 很小的时候参数量直接缩小几百上千倍。2. 前向传播公式原始输出\(yWx\) LoRA 引入增量分支完整输出\(\boldsymbol{y Wx \frac{\alpha}{r} BAx}\)W完全冻结不参与梯度更新保留全部预训练知识\(A,B\)唯一可训练参数\(\boldsymbol{\alpha}\)缩放超参数。一般设置 \(\alphar\)此时 \(\frac{\alpha}{r}1\)。当\(\alphar\)缩放项消失。3. 初始化策略很关键B矩阵初始化为全 0。训练刚开始时旁路分支输出 \(BAx0\)模型行为和原始预训练模型完全一致相当于从原始模型起点慢慢学习任务增量。A矩阵用高斯正态分布 \(A\sim N(0,\sigma^2)\)随机初始化。训练初期LoRA 分支输出接近 0不会一下子破坏预训练模型输出。4. 流程图对应图 (b)输入x分两路主干通路走原始冻结权重W输出WxLoRA 旁路通路\(x \xrightarrow{A(\text{降维})} \text{低维r维表示} \xrightarrow{B(\text{升维})}\) 得到增量输出BAx 两路相加得到最终输出。“降维再升维”A 把高维输入映射到很小的 r 维空间降维B 再把 r 维映射回原始输出维度升维。三、训练阶段 vs 推理阶段训练阶段✅冻结原始大模型所有权重W✅只对\(A、B\)两个小矩阵做反向传播更新梯度✅只需要保存 LoRA 的\(A、B\)权重体积很小几 MB 到几十 MB。多个不同下游任务可以对应多套独立的 LoRA 小权重共用同一个基础大模型。推理阶段LoRA 最大优势推理有两种模式权重合并模式无推理开销推荐把增量直接加到原始权重\(W W\frac{\alpha}{r}BA\) 之后直接用合并后的\(W\)做计算 \(yWx\)。 推理速度、显存占用和原始预训练模型完全一模一样没有任何额外延迟。不合并双分支推理推理时同时跑主干 W 和 BA 分支相加。会带来少量计算开销一般不生产环境不用。实际项目训练完 LoRA上线前把权重合并推理零代价。四、LoRA 一般作用在哪里论文原始建议只作用 Transformer 的 Attention 的 Query、Key 矩阵。实践现在也经常给 Value 层也加上 LoRA部分场景给 FFN 也加效果不一定提升参数量变大。为什么主要选 AttentionAttention 权重对下游任务适配最敏感FFN 更多存储通用知识。超参数 r秩怎么理解r越大可表达的增量\(\Delta W\)能力越强可训练参数量变多训练成本上升r越小参数量更小但表达能力不足效果变差。常见取值8,16,32简单任务 r8 足够复杂任务可以 64/128。不是 r 越大效果一定越好会过拟合。\(\alpha\)缩放系数多数实践直接设置 \(\alphar\)消除缩放因子。五、LoRA 和其他 PEFT 简单对比表格方法思路特点全量微调 FT更新全部 W效果最好成本极高LoRA冻结 W训练低秩分解 A、B推理可合并无延迟工业最主流Prefix Tuning在输入前增加虚拟前缀 token会增加序列长度推理有开销AdapterTransformer 层内插入小型全连接子网络推理有额外计算有延迟LoRA 最大卖点训练便宜推理零额外开销所以 LLaMA、Qwen 大模型微调SD 绘画模型微调大量用 LoRA。六、LoRA 优点 缺点✅优点极低训练开销只训练少量 A、B 参数显存需求远低于全量微调推理无代价权重合并后推理速度和原生模型一致不破坏基础模型基础权重 W 始终冻结不会灾难性遗忘任务解耦一套基础大模型加载不同 LoRA 小权重就切换不同任务LoRA 权重文件很小。兼容几乎所有 Transformer 架构大语言模型、扩散绘画模型。❌缺点秩r需要调参r 过小会欠拟合原始论文仅推荐 Attention 层FFN 上 LoRA 不一定收益如果多个 LoRA 需要同时生效不能简单合并需要特殊处理极端复杂任务效果会略低于全量微调。七、面试简答背诵版LoRA 是参数高效微调 PEFT 的重参数化方法。核心假设是下游任务对预训练权重的更新量\(\Delta W\)具备低秩特性。我们冻结预训练原始权重W新增两个小的低秩矩阵 A、B用 BA 近似权重更新量。训练时只更新 A、B推理时可以把 BA 合并回原始权重不会带来推理延迟。参数量小训练成本低广泛用于大模型微调。
返回列表