减少可避免偏差的技术:《机器学习训练秘籍》第 25 章实战解读

发布时间:2026/9/28 11:19:17
减少可避免偏差的技术:《机器学习训练秘籍》第 25 章实战解读 文档教程【免费下载链接】machine-learning-yearning-cnMachine Learning Yearning 中文版 - 《机器学习训练秘籍》 - Andrew Ng 著项目地址https://gitcode.com/gh_mirrors/ma/machine-learning-yearning-cn点击查看免费下载导读当你的模型在训练集上都无法达到理想表现时问题通常出在可避免偏差avoidable bias上。本文以 Andrew Ng 所著《机器学习训练秘籍》Machine Learning Yearning中文版第 25 章ch25.md为核心骨架系统梳理四种行之有效的降偏差手段加大模型规模、按误差分析修改输入特征、减少正则化、修改模型架构并明确指出添加更多训练数据为何无法解决偏差问题。读完本文你将掌握一套可复制的诊断与决策流程先量化可避免偏差再对症选择技术方案同时预判每项操作对方差的影响。一、先诊断再动手什么是高可避免偏差要正确使用第 25 章的技术清单必须先确认自己的问题确实属于高可避免偏差而不是高方差或其它问题。本书在 ch22.md 中给出了标准的误差分解方法可避免偏差 训练错误率 − 最优错误率贝叶斯错误率其中最优错误率即不可避免偏差代表即使由人类或世界上最好的分类器来完成该任务也无法消除的那部分误差。例如在语音识别任务中若 14% 的音频片段背景噪音过大、连人类都无法听清那么最优错误率就约为 14%。在此基础上本书将总误差拆解为不可避免偏差最优错误率本身可避免偏差训练错误率超出最优错误率的部分方差开发/测试错误率超出训练错误率的部分。只有当可避免偏差显著大于零时ch25.md 中列出的降偏差技术才值得投入。如果可避免偏差已经很小、主要差距在训练集与开发集之间即高方差那么应当转向 ch27.md 介绍的减少方差技术。注意负值情形若训练错误率低于最优错误率可避免偏差为负说明算法正在过拟合训练集此时应专注降低方差而不是继续减少偏差。二、四种有效的降偏差技术当你确认算法存在高可避免偏差后第 25 章给出以下四类可选方案按其本质可分为增强模型拟合能力与改变模型/数据形态两个方向。1. 加大模型规模神经元/层的数量核心机制加大模型规模可以增强模型对训练集的拟合能力从而直接拉低训练错误率、减小可避免偏差。这是深度学习中降低偏差最直接、最常用的一招。副作用与对策更大的模型通常伴随着更高的方差过拟合风险。当发现方差因此上升时通过加入正则化即可抵消方差的增加形成加大规模 正则化的组合拳。配套依据本书 ch23.md 对此有更深入的论述——如果算法含有一个精心设计的正则化方法通常可以安全地加大模型规模而不用担心增加过拟合风险只要正则化参数如 L2 强度、dropout 比例在开发集上调优到位加大规模后算法表现往往保持不变或提升不太可能明显变差。此时唯一不使用更大模型的理由就是计算代价不断加大网络规模终将遇到算力瓶颈训练一个大型模型需要更多时间。2. 根据误差分析结果修改输入特征核心机制误差分析Error Analysis能揭示算法在哪些特定类别的样本上犯错相关方法论见本书 Basic Error Analysis 一节。根据分析结论新增额外特征帮助算法消除特定类别的误差是兼具工程实操性与理论依据的手段。对偏差和方差的双向影响从理论上看添加更多特征会增大方差当这种情况发生时同样可以用正则化来抵消方差的增加。因此这项技术被本书同时列入减少可避免偏差ch25.md与减少方差ch27.md两个清单——它的主用方向取决于你新增的特征如何设计。如何落地本书 ch26.md 给出了在训练集上做误差分析的标准做法当算法高偏差无法很好拟合训练集时选取约 100 个算法处理得很差的样本人工逐一检查统计错误类别占比。以语音识别为例可构造如下错误分类表音频片段背景噪音很大语速太快距离麦克风太远备注1√汽车噪音2√√餐馆噪音3√√在起居室里喊叫4√咖啡厅占全体比例75%25%50%若发现 75% 的错误样本都伴随背景噪音大就可针对性地设计降噪、音频增强或噪音感知类特征/预处理让模型更好地适应这类输入。注意分析时还应检查正常人能否转录这些音频——如果噪音严重到人类都无法听懂那就不应指望算法识别正确这部分误差应归入不可避免偏差而非可避免偏差。3. 减少或者去除正则化L2、L1、dropout核心机制正则化L2 正则化、L1 正则化、dropout通过限制模型复杂度来抑制过拟合但代价是模型对训练集的拟合更保守从而抬高训练错误率。因此减少或去除正则化可以减小可避免偏差但会增大方差。与第 27 章的镜像关系本书 ch27.md 明确指出加入正则化L2、L1、dropout可以降低方差但增大了偏差。这与第 25 章的论述互为镜像——正则化强度是调节偏差/方差天平的核心旋钮之一。实操时建议若偏差为主逐步降低正则化强度如减小 L2 系数、调低 dropout 概率、放宽 L1 稀疏约束观察训练错误率是否下降若方差随之抬头不必全盘去除正则化而是在加大模型规模的基础上重新调优正则化强度让二者互相抵消。4. 修改模型架构如神经网络架构核心机制让模型架构更贴合问题本身的归纳偏置inductive bias能够同时影响偏差和方差——选对架构甚至可能同时降低两者。例如卷积结构之于图像、循环/注意力结构之于序列本身就是针对数据先验的强假设。现实预期管理本书 ch23.md 提醒尝试新架构的结果要比加大模型规模或添加数据更难以预测。不同架构对同一问题会呈现不同的偏差/方差组合近期深度学习研究已经开发出大量新架构若使用神经网络学术文献是很好的灵感来源社区中也不乏高质量的开源实现可供参考。但投入产出比具有不确定性应把它当作探索性手段而非保底方案。三、一种不能奏效的方法添加更多训练数据第 25 章特别强调添加更多的训练数据并不能有效降低可避免偏差。这与许多初学者的直觉相悖原因在于偏差的本质偏差非正式定义指算法在大型训练集上的错误率见 ch20.md。在训练集上添加更多样本只会让算法更难在训练集本身上做得更好——训练数据变多、拟合难度不降反升更多数据的作用域是方差本书 ch27.md 明确将其列为最简单最可靠的处理方差策略——只要拥有足够大的数据集理论上所有方差都是可以避免的ch22.md。因此正确的时间分配是偏差为主时数据再多也救不了训练集表现方差为主时数据才是最优先的杠杆。四、把技术放进决策框架偏差与方差的双向影响一览第 25 章的每项技术都不是免费的午餐它们几乎都会在偏差与方差之间产生联动。本书 ch24.md 解释了现代深度学习中这一权衡的松弛化在大数据 大模型时代你可以通过加大模型规模并调整正则化在不明显增加方差的前提下减少偏差也可以通过增加训练数据在不影响偏差的前提下减少方差。下表汇总第 25 章与第 27 章的技术及各自对偏差/方差的影响方向技术主要解决对可避免偏差对方差备注加大模型规模偏差减小增大配合正则化可抵消方差增加代价是算力修改输入特征按误差分析偏差/方差减小理论上增大用正则化抵消方差增加减少/去除正则化L2/L1/dropout偏差减小增大与第 27 章加入正则化互为镜像修改模型架构偏差/方差可能减小可能减小同时影响两者结果更难预测添加更多训练数据方差无明显影响减小对偏差无效勿用于降偏差加入提前终止early stopping方差增大减小见 ch27.md部分学者视其为正则化技术推荐执行顺序综合第 23、25 章用训练错误率与开发错误率完成偏差/方差定量诊断对照 ch21.md 的四个典型场景若可避免偏差高优先加大模型规模 正则化同时按误差分析结论补充关键特征若方差随之上升回归正则化调优而不是放弃模型规模若时间与算力允许再评估架构层面的改动切忌在偏差主导阶段盲目堆数据。五、常见误区与边界提醒不要把减少正则化当成默认选项去除正则化是降偏差的手段但会同时放大方差应在调参空间内谨慎、渐进地操作优先配合模型扩容。特征修改要有误差分析依据凭空猜测新特征往往事倍功半按 ch26.md 的方法先统计错误类别占比让特征服务于具体误差模式。区分不可避免偏差与可避免偏差若最优错误率本身很高如背景噪音导致人类也无法转录训练错误率即使略高于它可避免偏差也可能很小此时不应强行降偏差。架构改动需量化对比新架构的表现波动可能大于规模/数据调整务必以开发集指标为准绳避免凭感觉迭代。延伸阅读偏差/方差的非正式定义与误差分解ch20.md、ch22.md四类典型偏差/方差场景速查ch21.md偏差与方差权衡的现代视角ch24.md处理偏差与方差的总体策略ch23.md训练集误差分析实操ch26.md减少方差的技术清单与本文互为镜像ch27.md与人类水平比较、估计最优错误率Comparing to human-level performance 一节本书为 Andrew Ng 所著《Machine Learning Yearning》的中文翻译版本章节结构可在 _data/docs.yml 中查看欢迎通过 README.md 了解项目背景与阅读入口。掌握先诊断、后对症的偏差/方差决策框架是让上述技术真正发挥价值的先决条件。赞分享文档教程【免费下载链接】machine-learning-yearning-cnMachine Learning Yearning 中文版 - 《机器学习训练秘籍》 - Andrew Ng 著项目地址https://gitcode.com/gh_mirrors/ma/machine-learning-yearning-cn点击查看免费下载相关推荐机器学习优化指南减少可避免偏差的技术解析机器学习优化指南减少可避免偏差的技术解析 引言为什么可避免偏差是机器学习优化的关键瓶颈 在机器学习项目中你是否遇到过这样的困境模型在训练集上表现平平无文档教程《机器学习训练秘籍》ch23 实战解读如何正确处理偏差与方差《机器学习训练秘籍》ch23 实战解读如何正确处理偏差与方差 本文是 Andrew Ng《Machine Learning Yearning》《机器学习训练文档教程《机器学习训练秘籍》第 41 章精读如何用误差分解表辨别偏差、方差与数据不匹配《机器学习训练秘籍》第 41 章精读如何用误差分解表辨别偏差、方差与数据不匹配 导读 当训练集与开发/测试集来自不同数据分布时例如训练集用互联网图片、开发集文档教程上一篇TinaCMS tinacms/datalayer 数据层深度解析从文件索引到自托管后端的完整演进下一篇使用 instructor CLI 统一管理多 Provider 批处理任务创建、监控、取消与结果提取全指南创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考