L2 正则化在损失中加权重平方和惩罚,权重衰减在更新中直接收缩权重;二者在 SGD 中等价,在 Adam 中不等价——AdamW 因此诞生。

L2 正则化

训练损失加惩罚项:

梯度变为 :每步更新都把权重往 0 拉,压制大权重、抑制过拟合。 即各分量平方和(见 范数)。

在 SGD 中:二者等价

带 L2 正则的梯度下降一步:

“损失加 L2 项”与”每步先把权重乘 收缩”是同一件事,两种写法可以互换。

在 Adam 中:不等价

Adam 把衰减项当普通梯度处理:它进入一阶矩 ,又被二阶矩 缩放。权重的绝对值通常远大于其梯度,两路尺度不匹配,正则强度被自适应分母搅乱——想均匀压制所有权重,实际各参数受到的压制差异巨大,L2 正则基本失效。

AdamW 的解耦权重衰减:衰减不进梯度、不进矩估计,直接作用于参数:

每步精确收缩 ,正则强度可控。Transformer 训练几乎全部使用 AdamW,见 Adam算法全解:从数学原理到工业界最佳实践

实践细节

  • AdamW 的衰减量随学习率调度变化(),warmup 阶段衰减同样很弱;若需要衰减与调度完全解耦,得自定义实现
  • 经验值:CV 常用 ,LLM 视模型规模与调度取