LoRA(低秩适配):扩散模型的「插件式」定制技术
TL;DR
LoRA(低秩适配):扩散模型的「插件式」定制技术 | 触发:在探索 AI 视频生成(尤其是 Wan 2.2 Spicy 模型)时,理解了 LoRA(Low-Rank Adaptat
触发场景
在探索 AI 视频生成(尤其是 Wan 2.2 Spicy 模型)时,理解了 LoRA(Low-Rank Adaptation)这种模型微调技术的原理和应用场景。LoRA 是目前 AI 模型微调(尤其是扩散模型)里最常用、最高效的「插件式」定制技术。
行动步骤
- A:形状是 (r × k),r 是秩(通常 8~64,远小于原始维度)
- B:形状是 (d × r),d 是原始矩阵的输出维度
- r << d 和 k,所以参数量从 "d×k" 变成 "r×k + d×r",缩减几百到上万倍!
- α 是缩放因子(通常设为 1 或 rank 值),控制 LoRA 的强度
- 训练时只更新 A 和 B,原 W 完全冻结
- High Noise LoRA(高噪声 LoRA):负责扩散过程前半段(噪声很大时),主要决定整体构图、结构、大动作框架
- Low Noise LoRA(低噪声 LoRA):负责后半段(噪声很小时),主要精修细节、质感、动作连贯性、皮肤/身体细节
- 角色 LoRA:固定脸 + 身材
- 动作 LoRA:特定姿势、性爱动态
- 风格 LoRA:电影感、真实皮肤等
证据
什么是 LoRA?
大模型(如 Wan 2.2 的 140 亿参数)已经学了很多通用知识。但如果想让它「专精」某个东西(比如特定角色脸、特定动作、电影级动态),全参数微调太贵——需要几张 A100 + 几天时间。
LoRA 的解决方案是:只在模型的关键层额外加几个很小的「适配器」(大小通常只有几 MB 到几十 MB),原模型权重完全不动。
LoRA 的工作原理(带公式)
假设模型里某一层的权重矩阵是 W(原始的、冻结不动)。
传统微调会直接改 W → W + ΔW(ΔW 是全尺寸的,参数量巨大)。
LoRA 的 trick 是:把 ΔW 分解成两个极低秩的小矩阵:
ΔW = B · A
- A:形状是 (r × k),r 是秩(通常 8~64,远小于原始维度)
- B:形状是 (d × r),d 是原始矩阵的输出维度
- r << d 和 k,所以参数量从 "d×k" 变成 "r×k + d×r",缩减几百到上万倍!
实际前向传播时,模型输出变成:
h = Wx + α · (B · A) x
- α 是缩放因子(通常设为 1 或 rank 值),控制 LoRA 的强度
- 训练时只更新 A 和 B,原 W 完全冻结
这实现了「微创手术」:只改极少参数,却让模型学会新东西。
Wan 2.2 的特殊 LoRA 设计
Wan 2.2 采用 MoE(混合专家)+ 双噪声阶段架构,所以它的 LoRA 不是一个文件,而是需要两个:
- High Noise LoRA(高噪声 LoRA):负责扩散过程前半段(噪声很大时),主要决定整体构图、结构、大动作框架
- Low Noise LoRA(低噪声 LoRA):负责后半段(噪声很小时),主要精修细节、质感、动作连贯性、皮肤/身体细节
训练时大部分工具(AI-Toolkit、Musubi Tuner、Kohya-ss 等)会同时输出 high_noise_lora 和 low_noise_lora 两个文件。
推理(生成视频)时,要把两个 LoRA 分别加载到对应的噪声阶段(ComfyUI、WaveSpeedAI、Atlas Cloud 等平台都有对应插槽)。
实际应用场景
- 角色 LoRA:固定脸 + 身材
- 动作 LoRA:特定姿势、性爱动态
- 风格 LoRA:电影感、真实皮肤等
使用方式:在支持 Wan 2.2 的平台里,加载基础模型 → 丢入 high/low LoRA → 调权重(一般 0.8~1.5,动作激烈可拉到 2~5)→ 写好 prompt 就能生成。
失败边界
暂无已知失败边界
易混淆场景
暂无已知混淆场景
原理
LoRA 的核心原理是低秩分解(Low-Rank Decomposition)在深度学习微调中的应用。
直觉理解:当你训练一个大模型时,权重变化 ΔW 通常不需要全维度变化——它往往在一个低维子空间内就足够有效。LoRA 正是利用了这个性质,将 ΔW 约束在低秩子空间中,从而大幅减少需要训练的参数。
这与主成分分析(PCA)的思想类似:数据的真正变化往往可以用远少于原始维度的正交方向(主成分)来表示。LoRA 的秩 r 就是控制这个「压缩率」的超参数。
Wan 2.2 的双噪声阶段设计则利用了扩散模型的去噪过程天然分为「粗略构图」(高噪声)和「精细化」(低噪声)两个阶段,因此需要两个 LoRA 分别适配这两个阶段的不同特征。
关联与延伸
- 相关笔记:[[INDEX-ai]]
- 延伸阅读:- 相关模型:Wan 2.2 Spicy(无审查版)、Stable Diffusion、Flux
- 相关工具:ComfyUI、WaveSpeedAI、Atlas Cloud、AI-Toolkit、Musubi Tuner、Kohya-ss
- 硬件需求:单卡 24GB 显存可训 Wan 2.2 LoRA;Wan 2.2 Spicy 需要 RTX 4090(24GB)或 3090(24GB)
- 关联技术:[[OpenClaw 系统]]、[[Agent 角色定制]]
使用记录
| 日期 | 项目/场景 | 结果 | 备注 |
|------|----------|------|------|