L2正则化,防止过拟合-历史补充

L2 正则化核心原理笔记

Ltotal=Ldata+Lreg

Ltotal: 正则化后的成本

Ldata:训练数据的成本

Lreg:正则化成本 目标是最小化 Ltotal

所以 Ldata+Lreg 要最小

所以要考虑 Ldata 和 Lreg 同时最小

所以 Ldata 最小会拉高 W Lreg 最小会拉低 W 两者相互制衡,最终找到平衡点

这就是 L2 正则化限制 W 预防过拟合的原理

L2 正则化完整推导与原理

一、核心作用

  1. 抑制模型过拟合:惩罚过大的参数权重,不让任意特征权重无限制变大;
  2. 让权重整体趋向更小,但不会压缩到 0;
  3. 优化稳定,梯度平滑,广泛用于线性回归、逻辑回归、神经网络。

二、数学公式推导

以普通最小二乘线性回归举例:

1. 原始损失(MSE)

2. 加入 L2 惩罚项的总损失

L2 正则是对所有权重参数做平方求和,乘以正则系数lambda;偏置项不做正则

特性L2 正则L1 正则 (Lasso)
惩罚形式权重平方和权重绝对值和
权重效果全部缩小,不会等于 0可将不重要特征权重压缩至 0,实现特征筛选
等高线圆形菱形
求解处处可导,优化顺滑存在不可导点,多用坐标下降
别名岭回归Lasso 回归

六、底层为什么能防过拟合

过拟合本质:模型记住训练集噪声,依靠极端大权重拟合随机误差。 L2 限制权重上限:

  1. 不允许参数极端偏大,模型无法精准贴合训练噪声;
  2. 强制模型依赖更多特征共同预测,而不是少数几个特征猛拉数值;
  3. 参数更平滑,泛化能力提升,在测试集表现更稳定。