】2.2 神经网络组成)
神经网络组成通用机器学习流程与部署前置知识标准流程规范流程来源当前全行业通用的机器学习、深度学习、数据挖掘类流程均统一衍生自早期的 PASS 数据挖掘标准流程。核心环节标准流程固定为数据获取、数据准备、建模、模型评估、模型部署五大核心执行步骤。模型轻量化操作应用场景部署阶段的剪枝、量化属于模型轻量化操作核心用于计算资源有限的端侧设备运行场景。后续安排课程核心内容覆盖完成后将组织学员开展模型压缩实操实验验证量化操作的实际效果。神经网络核心基础概念前向传播机制前向传播对应前馈神经网络指初始化权重 W 后输入特征 X 计算得到预测值的正向信息传递过程。损失函数核心定义核心作用损失函数早期称代价函数对应英文 cost function是量化模型拟合效果的核心量化指标。计算逻辑主流二次代价函数计算所有样本真实值与预测值的差值平方和避免正负误差相互抵消。优化目标损失函数值越小代表模型权重 W 拟合效果越优核心优化方向为寻找损失函数的最小值点。反向传播与最小二乘法反向传播逻辑根据损失函数结果反向调整权重 W 与偏置 B实现损失函数下降的参数更新过程。最小二乘法定位是神经网络权重优化的核心基础算法是当前 BP 算法、大模型训练的底层支撑。最小二乘法逻辑通过对损失函数求导寻找最小值点公式中加入 1/2 系数用于抵消求导产生的系数 2。激活函数核心特性核心价值为神经网络引入非线性因素多层网络叠加激活函数后可拟合复杂曲线大幅提升模型拟合能力。主流类型包含 Sigmoid、ReLU、Softmax 等多类分别适配梯度抑制、梯度优化、多分类等不同应用场景。选型原则不同激活函数适配不同场景选型核心逻辑为扬长避短结合场景需求匹配对应特性。梯度下降算法体系批量梯度下降BGD运行逻辑每次更新参数时需代入全部样本数据计算负梯度方向参数更新的稳定性为三类算法最高。优缺点可稳定收敛至全局最优解但计算量最大样本量较大时参数更新速度会变得极慢。随机梯度下降SGD运行逻辑每次更新参数时仅随机选取单个样本计算负梯度方向单步参数更新的计算量为三类最小。优缺点参数更新速度快但对噪声敏感易陷入局部最优解无法保证最终收敛至全局最优。小批量梯度下降MBGD运行逻辑每次更新参数时选取自定义大小的小批量样本计算负梯度方向是前两种算法的折中方案。优缺点综合了前两种算法的优势更新速度快且稳定性高是当前工业界最常用的梯度下降方案。考核提示三类梯度下降算法的英文缩写 BGD、SGD、MBGD 为考核重点考试将直接使用英文缩写指代。主流优化器核心特性动量优化器通过引入动量项帮助模型跳过局部最优解参数更新步长固定易出现跳过全局最优解的问题。Adagrad 优化器核心逻辑采用自适应学习率初始阶段步长较大随迭代推进步长逐步缩小避免跳过全局最优解。固有缺陷分母随迭代持续累加会不断增大易导致迭代后期步长过小未收敛至最低点就停止更新。Adam 优化器核心逻辑综合动量优化器与 Adagrad 的优势采用双动量系数分别控制惯性与记忆长度实现自适应学习。应用定位是当前工业界应用最广泛的优化器方案可适配绝大多数复杂网络的训练需求。参数提示学习率为模型训练的核心超参数设置合理性直接决定模型收敛效果需结合具体场景调整。过拟合问题与正则化方案过拟合核心定义问题本质模型对训练数据拟合过度甚至达到 100% 准确率泛化能力与鲁棒性极差生产环境无法使用。典型表现输入存在微小瑕疵的样本时模型会出现完全不符合逻辑的错误判断无法适配真实场景变化。正则化核心方案核心逻辑通过在损失函数中加入惩罚项避免模型完全拟合训练数据从根源上抑制过拟合问题。主流分类分为 L1 正则取权重绝对值可用于特征选择与 L2 正则取权重平方应用范围更广两类。其他过拟合解决方案数据层面通过扩充数据集、数据旋转/灰度变换、添加噪声等方式丰富训练数据的多样性。训练层面采用 Dropout 随机丢弃部分神经元、提前停止训练等方式避免模型过度拟合训练数据。考核提示过拟合的解决方案为核心考核点需重点记忆 Dropout、增广数据集、L1/L2 正则三类方案。后续工作计划模型压缩实验课程核心内容覆盖完成后组织学员开展模型压缩实操实验验证量化操作的实际效果。剩余知识点讲授本次课程未完成的深度学习相关知识点将统一安排在下一课时进行系统讲解。