07-逻辑回归概述

发布时间:2026/7/26 9:05:07
07-逻辑回归概述 逻辑回归是一个有监督学习算法有特征、有标签、标签离散分类一般用于二分类问题。应用场景预测疾病、银行信贷、情感分析、预测广告点击...1. 原理1.1 概念逻辑回归是一种分类模型把线性回归的输出作为逻辑回归的输入最后输出(0,1)之间的值。线性回归处理后的值 —— sigmoid激活函数映射到[0,1]之间 —— 结合阈值划定分类1.2 思想利用线性回归模型根据特征的重要性计算出一个值用 sigmoid 函数将输出值映射为概率值设定一个阈值如0.5如果0.5则认定未知样本1类否则为0类1.3 损失函数其中为真实样本的值为预测的概率值。当预测概率越接近 1损失越小当预测概率越接近 0损失越小。推理二分类问题概率分布函数其中为概率值。构造1个样本的概率多个样本的概率则问题转化为极大似然估计。估计w, b让这个联合概率最大对数变换其中.将最大化问题转化为最小化问题然后用梯度下降法估计参数。2. API默认将类别数量少的作为正例from sklearn.linear_model import LogisticRegression estimator LogisticRegression( solver liblinear, # 对小数据场景训练更快sag、saga大数据更快 penalty l2, # L2正则化 C 1.0 # 正则化力度 )3. 分类问题评估3.1 混淆矩阵from sklearn.metrics import confusion_matrix label [1, 0] # 数据中y的标签先正例后反例 df_label [正例, 反例] cm confusion_matrix(y_test, y_pre, labelslabel) cm_df pd.DataFrame(cm, indexdf_label, columnsdf_label) print(混淆矩阵\n, cm_df)3.2 精确率、召回率、F1-score精确率预测为真正例TP占所有预测正样本的比重召回率预测为真正例TP占所有真实正样本的比重F1-score兼顾精确率和召回率精确率和召回率是此消彼长的关系from sklearn.metrics import precision_score, recall_score, f1_score from sklearn.metrics import classification_report print(精确率, precision_score(y_test, y_pre, pos_label1)) # 参数解释pos_label1表示正例的标签是1 print(召回率, recall_score(y_test, y_pre, pos_label1)) print(F1-score, f1_score(y_test, y_pre, pos_label1)) # 一次性获取 print(分类报告\n, classification_report(y_test, y_pre, labelslabel, arget_namesdf_label))3.3 ROC曲线和AUCTPR召回率/灵敏度预测为真正例TP占所有预测正样本的比重FPR预测为伪正例FP占所有真实负样本的比重ROC曲线评估分类模型性能展示模型在不同阈值下的表现情况AUCROC曲线下的面积表示模型的分类性能。AUC0.5表示模型分类性能等于随即猜测AUC1表示模型可以完全正确地区分正负样本from sklearn.metrics import roc_curve, auc fpr, tpr, thresholds roc_curve(y_test, y_pre, pos_label1) # pos_label: 正例标签 print(fpr, fpr) print(tpr, tpr) print(阈值, thresholds) auc auc(fpr, tpr) plt.plot(fpr, tpr, labelROC curve (area %.2f) % auc) plt.legend() plt.show()案例汇总癌症预测电信客户流失预测补充知识A sigmoid激活函数作用把映射到.性质单调递增函数拐点在x0y0.5的位置导函数公式B 概率概率事件发生的可能性联合概率指2个及以上的事件同时发生的概率。P(AB)条件概率已知A发生的条件下也发生B的概率。P(B|A)C 极大似然估计根据观测到的结果估计模型算法中的未知参数如假设有一枚不均匀的硬币出现正面的概率和反面的概率是不同的。假定出现正面的概率为θ抛了6次得到如下现象D{正面反面反面正面正面正面}。每次投掷事件都是相互独立的。则根据产生的现象D来估计参数θ是多少?问题转化为求该函数的极大值得到θ的估计令解得取.例已知X的概率密度函数为,是一组样本值求参数的极大似然估计。解似然函数等式两边同取自然对数对参数求导并令其为0当时概率最大D 对数函数如果(a0, b≠1)则b为以a为底N的对数。性质其中a0, M0, N0其中a0, M0, N0其中a0, M0