机器学习中的范数:从L1、L2到L2,1,理解正则化与稀疏性的核心原理

发布时间:2026/8/16 5:50:14
机器学习中的范数:从L1、L2到L2,1,理解正则化与稀疏性的核心原理 1. 从“距离”到“规则”范数到底是什么刚入行做机器学习或者优化相关项目时你肯定被各种“范数”绕晕过。模型损失函数里加个L1、L2正则项论文里动不动就提矩阵的F范数、核范数还有像L2,1这种看起来像“混血”的范数。很多人一开始都是硬背公式套进代码里能用就行但心里总有个疙瘩这玩意儿到底在度量什么为什么L1能让参数变稀疏L2就不行今天我就结合自己这些年踩过的坑和实际项目里的应用把这些范数掰开揉碎了讲清楚。我们不搞复杂的数学证明就从最直观的“距离”和“规则”两个角度来理解你会发现它们其实是你工具箱里非常趁手的几把尺子。简单说范数Norm就是给向量或矩阵“量个头”的尺子它把一个包含多个数字的复杂对象映射成一个单一的非负实数这个实数代表了该对象的某种“大小”或“长度”。在机器学习和数据科学里范数远不止是算个长度那么简单它核心扮演了两个角色一是作为损失函数中的误差度量告诉我们预测值和真实值差多远二是作为正则化项中的惩罚器给模型参数立规矩防止它学“飘”了过拟合。L1和L2是最常用的两把尺子而L2,1范数则是处理结构化稀疏问题的特种尺。理解了它们你就能更自信地调参、设计模型甚至看懂很多论文里的优化思路。2. 向量范数L1与L2的直观较量我们最常见的操作对象是向量比如一个样本的特征向量或者模型参数的向量。给向量定义范数最符合直觉的就是从几何上的“距离”出发。2.1 L2范数最熟悉的“直线距离”L2范数也叫欧几里得范数这是我们从小学就开始接触的概念。对于一个n维向量x [x₁, x₂, ..., xₙ]ᵀ它的L2范数定义为||x||₂ √(x₁² x₂² ... xₙ²)这不就是空间中点到原点的直线距离公式嘛。在机器学习里均方误差MSE损失函数本质上就是预测误差向量的L2范数的平方。L2范数最大的特点是它是光滑、可导的除了零点这个性质在优化中至关重要因为基于梯度下降的算法如SGD、Adam依赖可导性才能工作。注意在代码实现和有些文献里你可能会看到直接使用平方和而不开方比如L2正则项通常写作λ * Σ(w_i²)。这本质上和最小化L2范数是等价的因为开方是单调函数不影响优化方向。但严格来说惩罚项是L2范数的平方这样求导更干净导数是2λw_i。实操心得当你使用L2范数作为误差度量时它对大的误差值惩罚非常重因为平方项。这意味着你的模型会特别“厌恶”出现大的预测偏差会努力把那些偏差大的样本也拟合好。这有时是个优点但有时如果数据中有异常值OutliersL2损失会被这些异常值“带跑偏”因为模型会为了拟合少数几个异常值而牺牲整体性能。这时L1损失可能更稳健。2.2 L1范数“城市街区距离”与稀疏性魔法L1范数也叫曼哈顿范数或绝对值范数定义如下||x||₁ |x₁| |x₂| ... |xₙ|想象一下在曼哈顿街区你不能斜着穿楼只能沿着街道直角转弯从A点到B点的最短路径长度就是L1距离。与光滑的L2不同L1范数在坐标轴上是不可导的在零点处导数不存在在其他点导数要么是1要么是-1。这个看似“缺陷”的性质却带来了一个关键的超能力诱导稀疏性Sparsity。为什么L1能产生稀疏解我们可以从几何和优化角度直观理解。考虑一个最简单的线性回归加上正则项后我们是在最小化损失函数 λ * 范数(参数w)。这个优化问题的解可以看作是在损失函数的等值线/面和范数约束的“球”的切点处取得。L2约束||w||₂ ≤ t是一个光滑的圆球。它与损失函数等值线的切点很容易落在坐标轴上吗很难除非等值线本身有特殊的朝向。因此解w的各个分量通常都是非零的。L1约束||w||₁ ≤ t是一个菱形在二维下是旋转45度的正方形。这个菱形在坐标轴上有尖角。损失函数等值线与这个菱形相切时有非常大的概率正好切在某个尖角上而在尖角上就意味着某些坐标即某些参数w_i恰好为0。应用场景这就是L1正则化LASSO可以做特征选择的根本原因。它倾向于把不重要的特征对应的权重直接“压缩”到零从而得到一个稀疏的模型。这不仅降低了模型复杂度还提升了可解释性。在金融风控、生物信息学基因选择等领域这个特性价值连城。踩坑记录由于L1在零点不可导直接用标准梯度下降会出问题。在实际优化中我们通常使用近端梯度下降Proximal Gradient Descent或坐标下降法Coordinate Descent等专门算法。像Scikit-learn中的Lasso模型内部就使用了坐标下降。如果你自己实现带L1正则的模型千万别直接用SGD记得要处理次梯度Subgradient或者用现成的优化器。2.3 L2归一化一个常被混淆的重要操作这里插一个热词“L2归一化”它和L2范数紧密相关但目的不同。L2归一化L2 Normalization是指将一个非零向量x除以其自身的L2范数得到一个单位向量长度为1x_normalized x / ||x||₂这个操作不改变向量的方向只改变其长度模长为1。它在机器学习和数据预处理中极其常见特征缩放将不同特征缩放到统一的尺度单位球面上避免某些特征因量纲大而主导模型训练。余弦相似度计算两个向量经过L2归一化后它们的内积就等于余弦相似度cosine similarity这在文本处理如词向量、图像检索、推荐系统中是计算相似度的标准操作。稳定训练在某些神经网络层如某些Embedding层后加入L2归一化可以稳定训练过程防止梯度爆炸或消失。注意L2归一化不是正则化。正则化是在损失函数里加惩罚项目的是限制参数大小而归一化是对数据或中间表示的一种变换目的是改变其分布或尺度。别把这两个概念搞混了。3. 矩阵范数从向量到高维的延伸当我们的参数不再是向量而是矩阵比如全连接层的权重矩阵、卷积核时就需要矩阵范数。矩阵范数可以看作是将矩阵“向量化”后再应用向量范数但通常有更符合矩阵运算特性的定义方式。3.1 Frobenius范数最直接的推广Frobenius范数F范数是最常用、最直观的矩阵范数。对于一个m×n的矩阵A其F范数定义为所有元素平方和的平方根||A||_F √(Σ_i Σ_j |a_ij|²)你可以把它理解为将矩阵A拉直成一个长向量然后对这个向量求L2范数。因此它继承了L2范数的所有光滑特性。在神经网络中权重衰减Weight Decay通常就是对所有权重矩阵的F范数平方进行惩罚。它均匀地缩小所有参数是一种温和的正则化手段。实操要点在PyTorch或TensorFlow中计算一个权重矩阵W的L2正则项即F范数平方非常方便通常就是torch.sum(W ** 2)。优化器中的weight_decay参数就是自动为你添加了这个惩罚项。3.2 核范数与谱范数基于奇异值的度量除了F范数还有两类基于矩阵奇异值Singular Value的重要范数它们揭示了矩阵更深层的结构信息。核范数Nuclear Norm定义为矩阵所有奇异值之和即||A||_* Σ_i σ_i。其中σ_i是矩阵A的奇异值。核范数是矩阵的秩Rank的凸松弛。最小化核范数可以诱导出低秩矩阵解。这在矩阵补全如推荐系统里的协同过滤、鲁棒PCA从数据中分离低秩背景和稀疏噪声等任务中是无价之宝。谱范数Spectral Norm定义为矩阵最大的奇异值即||A||_2 σ_max。它衡量的是矩阵作为线性算子时的最大“拉伸”能力。在生成对抗网络GAN中为了稳定训练常常会对判别器或生成器的权重矩阵进行谱归一化Spectral Normalization就是强制让权重矩阵的谱范数约等于1从而控制Lipschitz常数防止梯度异常。理解技巧可以把奇异值想象成矩阵在不同方向上的“放大倍数”。核范数关心所有放大倍数的总和整体规模而谱范数只关心最大的那个放大倍数最激进的方向。F范数则是把这些放大倍数平方和再开方是另一种整体规模的度量。4. L2,1范数结构化稀疏的特种兵终于轮到标题里这个看起来有点奇怪的L2,1范数了。它也叫组稀疏范数或行稀疏范数是一种混合范数专门用于诱导结构化稀疏Structured Sparsity。4.1 定义与计算方式假设我们有一个矩阵X∈ R^(m×n)我们可以把它看作是由m个行向量每组组成的。L2,1范数的计算分两步走对每一行计算其L2范数即该行所有元素的平方和开方。这样我们就把一个矩阵压缩成了一个长度为m的向量向量中每个元素代表一行的“强度”。对这个由行L2范数组成的向量再计算其L1范数即所有行的“强度”绝对值求和。公式表示为||X||_{2,1} Σ_i (√(Σ_j X_{ij}²)) Σ_i ||x^i||_2其中x^i表示矩阵X的第i行。通俗理解L2,1范数先按行“抱团”算L2再让行与行之间“竞争”算L1。L1的部分会倾向于让很多行的“强度”变成零。而一旦某一行的L2范数即强度为零就意味着这一整行的所有元素都为零。4.2 核心应用多任务学习与特征选择这才是L2,1范数的威力所在它惩罚的是整行而不是单个元素。这带来的结果是整行被置零即组级别的稀疏性。经典场景一多任务学习Multi-task Learning假设我们有k个相关的学习任务比如预测k种不同的疾病每个任务对应一个模型参数向量w_t。我们可以把所有参数向量堆叠成一个矩阵W其中每一行对应一个特征在所有任务上的权重。 当我们用L2,1范数正则化这个矩阵W时优化过程会倾向于让某些行的L2范数变为零。这意味着对应这些行的特征它在所有任务上的权重都被抑制为零。换句话说我们筛选出了对所有任务都不重要的特征实现了跨任务的联合特征选择。这对于发现共享的、底层的生物标记物或通用特征非常有帮助。经典场景二矩阵补全与鲁棒回归在数据可能存在异常值或噪声的情况下L2,1范数可以作为损失函数。例如在鲁棒主成分分析RPCA的变体中用L2,1范数度量误差矩阵可以鼓励误差矩阵的整行或整列为零这对应于某些样本在所有维度上都是异常值可以被整体识别和剔除。实操心得与坑点优化算法和L1范数一样L2,1范数也是非光滑的在行向量为零处不可导。优化时需要用到它的近端算子Proximal Operator。对于L2,1范数其近端算子被称为分组软阈值Group Soft Thresholding。具体来说对于一行向量x其近端操作是prox_{λ||·||_2}(x) max(0, 1 - λ / ||x||_2) * x看到这个公式就明白了如果这一行的L2范数||x||_2小于阈值λ那么整行被置零否则整行按比例收缩。很多优化库如scikit-learn的MultiTaskLasso已经实现了这个算法。与L1的区别普通的L1作用于矩阵即向量化后是鼓励每个元素单独为零是“点稀疏”。而L2,1是“线稀疏”或“组稀疏”。选择哪种取决于你的问题中是否存在天然的分组结构。如果你的特征有分组信息例如基因通路、单词的n-gram、图像中的局部块那么L2,1或更一般的Group Lasso是更合适的选择。5. 正则化实战如何选择与调参了解了各种范数的特性最终要落到应用上我该用哪个怎么用5.1 选择指南L1、L2还是L2,1我们可以用一个简单的决策流来辅助选择正则化类型核心特性诱导的稀疏性主要应用场景优化注意事项L2 (岭回归)光滑可导均匀收缩无参数稠密防止过拟合稳定解处理特征共线性标准梯度下降即可非常稳定L1 (LASSO)在零点不可导有尖角元素级稀疏特征选择模型压缩提高可解释性需用坐标下降、近端梯度等L2,1 (Group Lasso)按组如行不可导组级稀疏多任务学习结构化特征选择鲁棒分析需用分组软阈值或专门优化器更复杂的情况你甚至可以混合使用比如弹性网Elastic Net就是L1和L2的线性组合结合了特征选择和稳定性的优点。公式为λ₁||w||₁ λ₂||w||₂²。当特征高度相关时LASSO可能只随机选择其中一个而弹性网则倾向于将相关特征一起选入或剔除。5.2 超参数λ惩罚力度的艺术正则化项前面的系数λ或alpha是控制惩罚力度的超参数。λ越大惩罚越重模型越简单参数趋向于零。调参经验从网格搜索或随机搜索开始通常在对数尺度上进行搜索例如[1e-5, 1e-4, 1e-3, 1e-2, 0.1, 1, 10]。L1对λ更敏感小的变化可能导致选入的特征数量剧烈变动。使用交叉验证一定要用交叉验证来评估不同λ下模型的性能如均方误差、准确率选择在验证集上性能最好的λ。对于LASSO可以观察随着λ增大特征系数路径Coefficient Path的变化。结合标准化非常重要在加入L1或L2正则化之前必须对特征进行标准化如Z-score标准化使均值为0方差为1。因为正则化惩罚的是系数大小如果特征A的取值范围是[0, 1000]特征B是[0, 1]那么即使B更重要A的系数也会被不公平地惩罚得更厉害。标准化让所有特征站在同一起跑线上。理解λ与稀疏度的关系对于LASSO存在一个λ_max当λ λ_max时所有系数都被压缩为零。随着λ减小系数逐个被“释放”出来。你可以通过观察这个路径来分析特征的相对重要性。5.3 一个简单的代码示例对比L1与L2我们用一个简单的线性回归例子在合成数据上直观感受L1和L2正则化的区别。import numpy as np import matplotlib.pyplot as plt from sklearn.linear_model import Lasso, Ridge from sklearn.preprocessing import StandardScaler from sklearn.pipeline import make_pipeline # 1. 生成合成数据只有5个特征真正有用其他15个是噪声 np.random.seed(42) n_samples, n_features 100, 20 true_coef np.zeros(n_features) true_coef[:5] [5, -3, 2, -1, 4] # 前5个是有效特征 X np.random.randn(n_samples, n_features) y X.dot(true_coef) np.random.randn(n_samples) * 0.5 # 加噪声 # 2. 创建并训练模型包含标准化步骤 alphas np.logspace(-3, 1, 10) # 测试不同的λ coefs_lasso [] coefs_ridge [] for alpha in alphas: # Lasso (L1) lasso make_pipeline(StandardScaler(), Lasso(alphaalpha, max_iter10000)) lasso.fit(X, y) coefs_lasso.append(lasso.named_steps[lasso].coef_) # Ridge (L2) ridge make_pipeline(StandardScaler(), Ridge(alphaalpha)) ridge.fit(X, y) coefs_ridge.append(ridge.named_steps[ridge].coef_) # 3. 绘制系数路径图 plt.figure(figsize(12, 5)) plt.subplot(1, 2, 1) plt.plot(alphas, coefs_lasso) plt.xscale(log) plt.xlabel(Lambda (alpha) - Log Scale) plt.ylabel(Coefficient Value) plt.title(LASSO (L1) Coefficient Paths) plt.axvline(x0.1, colorgray, linestyle--) # 标记一个参考点 plt.legend([fFeat {i} for i in range(n_features)], locupper right, fontsizex-small) plt.subplot(1, 2, 2) plt.plot(alphas, coefs_ridge) plt.xscale(log) plt.xlabel(Lambda (alpha) - Log Scale) plt.ylabel(Coefficient Value) plt.title(Ridge (L2) Coefficient Paths) plt.axvline(x0.1, colorgray, linestyle--) plt.tight_layout() plt.show()运行这段代码你会清晰地看到左图LASSO随着λ增大许多特征的系数精确地变为零线触及横轴实现了稀疏性。最终只有少数几个重要特征存活下来。右图Ridge随着λ增大所有系数都平滑地收缩趋近于零但几乎没有哪个会精确等于零。所有特征都保留在模型中只是影响力变小了。6. 常见问题与排查技巧实录在实际项目中应用范数和正则化时会遇到一些典型问题。这里记录几个我踩过的坑和解决方法。问题1加了L1/L2正则化模型效果反而变差了可能原因1λ值太大。惩罚过重把有用的信号也压制了导致模型欠拟合。排查绘制验证集性能随λ变化的曲线验证曲线选择一个在拐点附近的λ而不是盲目取大。可能原因2特征未标准化。这是最常见的原因如前所述不同尺度的特征受到不公平的惩罚导致模型学习出现偏差。解决在任何线性模型使用L1/L2正则前务必使用StandardScaler或MinMaxScaler进行特征标准化。可能原因3数据本身噪声大或线性假设不成立。正则化主要解决过拟合但如果模型本身因为欠拟合如特征与目标关系非线性而表现差正则化帮不上忙甚至可能雪上加霜。排查先检查不使用正则化的模型λ0性能如果它已经很差问题可能出在特征工程或模型选择上。问题2使用LASSO做特征选择每次跑选出的特征都不一样可能原因1数据随机性。如果数据量小或者数据分割训练/测试集不同LASSO路径可能不稳定。解决使用稳定性选择Stability Selection或集成Lasso如 Bolasso。多次重采样数据运行LASSO统计每个特征被选中的频率选择频率高的特征。可能原因2特征高度相关。当两个特征高度相关时LASSO可能随机选择其中一个导致结果不稳定。解决考虑使用弹性网Elastic Net它对相关特征分组选择结果更稳定。或者先进行聚类或主成分分析PCA处理相关性。问题3实现L2,1范数正则化时优化不收敛或很慢可能原因1优化算法不合适。直接使用SGD或Adam无法正确处理L2,1范数的非光滑性。解决使用近端梯度法Proximal Gradient Method或加速近端梯度法如FISTA。在PyTorch中可以自定义近端算子结合优化器手动实现或者使用像sparseml这样的库。可能原因2学习率设置不当。近端梯度法对学习率敏感。解决使用线搜索Line Search来确定合适的学习率或者采用自适应学习率的变种。可能原因3分组定义错误。L2,1范数的效果严重依赖于你的分组结构。如果分组不合理比如把不相关的特征强行分在一组效果会很差。解决仔细审视你的问题领域基于先验知识如基因属于同一通路、像素属于同一图像块来定义分组。问题4如何解释L2,1范数正则化后的模型解释重点在“组”不要只看单个特征的系数是否为零。L2,1范数的核心输出是哪些组行被整体置零了。这意味着你可以说“根据模型第X组特征例如代表‘纹理’特征的所有统计量对任务没有贡献可以被安全移除。” 这比解释单个特征更具结构性和可理解性尤其在高维领域如神经影像分析或基因组学中。范数这把尺子从度量误差到施加约束贯穿了机器学习的模型、损失和优化。理解L1、L2、L2,1之间的微妙差别能让你在调参和设计模型时不再凭感觉瞎试而是有据可依。下次当你加上一个正则化项时不妨多想一步我期待模型发生什么样的变化是希望它更平滑还是更稀疏或者是某些部分结构性地消失想清楚了这个问题范数的选择就自然清晰了。

相关新闻