跳到主内容
@wquguru
精选86elvis技巧与观点

NoRA:对LoRA进行归一化改进提升训练稳定性与收敛速度

// Normalized Low-Rank Adaptation (NoRA) //

原文
发到 X
推荐理由

做模型微调的同学必看,只需改动一行初始化代码就能显著提升LoRA的稳定性和收敛速度,零额外推理成本,建议直接应用到你的SFT或RLHF流程中验证效果。

// Normalized Low-Rank Adaptation (NoRA) //

// 归一化低秩自适应 (NoRA) //

They propose a one-line change to LoRA that costs nothing and improves convergence, stability and forgetting.

他们提出对 LoRA 进行一行代码的修改,该修改无需额外成本,却能提升收敛速度、稳定性和减少灾难性遗忘。

LoRA initializes the up-projection to zero, which means early optimization is governed almost entirely by the down-projection. This observation tells you where to regularize.

LoRA 将上投影矩阵初始化为零,这意味着早期优化几乎完全由下投影矩阵主导。这一观察结果指出了正则化的方向。

NoRA normalizes the down-projection matrices during training. The authors also show the same normalization applied once at initialization improves standard LoRA without repeating it through training, which is the cheaper of the two options.

NoRA 在训练期间对下投影矩阵进行归一化。作者还表明,仅在初始化时应用一次相同的归一化即可改进标准 LoRA,而无需在整个训练过程中重复此操作,这是两种方案中更经济的一种。

The benefits hold across pretraining, supervised fine-tuning and reinforcement learning. Faster convergence, better final performance, more stable training, and less catastrophic forgetting.

这些优势在预训练、监督微调和强化学习中均成立:收敛更快、最终性能更好、训练更稳定,且灾难性遗忘更少。

It adds no trainable parameters and no inference-time computation, which is what makes it broadly applicable rather than another specialized LoRA variant.

它不增加任何可训练参数,也不增加推理时的计算量,这正是它能够广泛适用而非另一种专用 LoRA 变体的原因。

Paper: https://academy.dair.ai/papers/normalized-low-rank-adaptation-2608.31036

论文:https://academy.dair.ai/papers/normalized-low-rank-adaptation-2608.31036

更进一步:量化金融体系

看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力

进入量化体系 →

相似阅读

关联信息,但可能不是同一事件