
FFN前馈神经网络一、MCP单层感知机1、实现流程输入信号、加权求和、非线性激活、逻辑回归/softmax回归输出2、特点a二值化的线性模型模拟单个神经细胞只有抑制和兴奋两种状态**b网络参数权重W和偏置b**可学习3、激活函数a、概述注不加非线性激活函数再多的隐藏层都相当于单层感知机b、适用场景输出层sigmoid二分类、softmax多分类隐藏层激活函数RELU导数为1ques为什么用RELU做激活函数计算相对sigmoidtanh更简单缓解梯度消失输出部分神经元为0增强网络稀疏化防止过拟合二、FFN前馈神经网络1、定义FFN泛指所有单向信息流的神经网络MLP特指包含至少一个隐藏层且使用非线性激活函数的FFNMLP是FNN的子集2、特点a各神经元属于不同的层、层内无连接b前馈信息单向传播c全连接两层之间的神经元全部两两相连3、理论基础通用近似定理线性输出至少一个非线性激活函数层数足够—任意逼近4、前向传播注每一个隐藏层加一次偏置bb是数学意义上逐元素相加而非矩阵叠加5、BP梯度反向传播维度确定a、向量与标量求导技巧核心1、标量不变向量拉伸2、前面横向拉后面纵向拉后×前(dy/dx的话就是Y横向拉伸X纵向拉伸b、矩阵与标量求导结果永远为矩阵的维度具体表达式先根据代数运算写出再通过添加转置和交换顺序变为矩阵维度eg注意区分Xij和X其中X是矩阵而Xij只是一个一维分量。参考资料ques梯度消失和梯度爆炸的定义与原因原因隐藏层层数过多梯度消失BP反向传播时神经网络层数多时每一层相对前一层乘上一个小数累乘叠加使得得到梯度过小近似消失 梯度爆炸累乘指数爆炸解决方案1、RELU激活函数 2、残差连接 3、减少参数量预训练与微调/LSTM和GRU中的门结构 4、限制上限梯度剪切/正则化6、BP梯度反向传播目的具体计算a红前向传播和反向传播公式b蓝各偏导维度7、FFN中参数量的确定准确的说是针对全连接层的而非所有FFN注FFN中输入大小i需要同时考虑输入图像大小和图像通道数eg