8-13课程归纳

发布时间:2026/9/16 8:54:30
8-13课程归纳 8.线性回归与优化算法线性回归预测一个连续值训练的时候按照和真实值的区别来作为损失梯度下降算法其中的η被称为超参数不能选太大也不能选太小wt表示模型的参数梯度算的是损失函数变化最大的方向所以要沿着反方向来更新参数。9.分类通常会对类别做一位有效编码y[y1,y2,…yn]结果是[0,1,…]就说明输出的是第二类通常以softmax 的结果也就是置信度最高的类别那个来作为预测的结果softmax所做的事情就是把原始分数压缩成一组加起来为 1 的概率百分比而且原来分数高的占比会更高得到的概率也被称为置信度交叉熵损失用于衡量模型预测所得的概率和真实概率之间的区别比如模型预测结果[猫狗兔][0.65,0.24,0.11],而真实概率却是[1,0,0].而交叉熵并不是像p−q 那样直接做差而是通过 log 来放大差距这样预测概率离真实概率越远损失增长得越快而且是指数级地快10.感知机单层单层感知机只能分两类yes/no把几个输入加权求和如果超过某个门槛就输出是1否则输出否0相当于在平面上画一条分割线。多层MLP大体可以分成输入层-隐藏层-输出层输入层接收原始数据隐藏层提取特征输出层综合隐藏层的结论得出最后的结果即这份数据代表了什么。它与单感知层一个很大的区别就是单感知层用阶跃函数来做分类而多感知层用非线性激活函数其最大的作用就是可以让网络去拟合任意复杂函数解决非线性问题当边界可以被扭曲模拟后进而它可以做更多的事情比如多分类输出用softmax也可以进行数据压缩。最常用的激活函数就是relu11.模型选择训练误差和泛化误差训练误差模型在训练数据上的误差泛化误差模型在新数据上的误差验证数据集通常从训练集中拿出一半左右的数据来作为验证集用来评估模型的好坏测试数据集只用一次的数据集即测试泛化误差。尤其不能在测试集上进行超参数的调整K-则交叉验证没有足够数据时将数据分成k块训练k次每次使用第i块来作为验证集其他的作为训练数据集。最后取k个验证集的误差平均欠拟合与过拟合指的是模型容量和数据大小的关系如果模型容量很大但是数据集很小那就过拟合了如果模型容量很小数据集很大那就欠拟合了12.权重衰退目的是确保模型参数不会变得过大13.丢弃法训练时随机暂停一部分神经元的工作使得网络不会过分依赖某几个节点。具体的做法就是加了 Dropout 之后每次训练迭代时每个神经元以概率p比如 0.5被临时丢弃输出直接置 0被丢弃的神经元这一步不参与计算也不更新权重。该方法通常被用在隐藏层的输出上