GBDT 与 XGBoost 知识点总结

发布时间:2026/8/25 1:59:10
GBDT 与 XGBoost 知识点总结 一、GBDT 与 XGBoost 核心对比对比维度sklearn GBDTXGBoost损失函数原理仅利用一阶负梯度拟合二阶泰勒展开精度更高正则化能力仅靠树深、叶子最小样本数等基础控制额外支持L1、L2 正则化正则体系更完善分裂增益计算基于 MSE 减少量计算基于加入正则项后的增益公式计算分裂更严谨缺失值处理不支持需提前手动填充自动学习缺失值的最优分裂方向训练速度单线程速度慢速度快 5~10 倍XGBoost 提速的核心原因支持多线程并行在单棵决策树的节点分裂阶段并行计算将连续特征离散化分到多个桶中仅在桶边界搜索最优分裂点无需遍历所有样本值二、采样策略1. 行采样GBDT、XGBoost 均推荐使用行采样训练模型。定义无重复地抽取部分训练样本如 80% 样本和随机森林的「有放回采样」核心区别是无重复、不放回。作用防止过拟合、增强模型随机性、提升泛化能力。2. 列采样定义从全部特征中随机挑选一部分用于节点分裂对应参数colsample_bytree。与行采样的区别行采样从样本维度挑选列采样从特征维度挑选效果类似随机森林的随机特征选择。三、XGBoost 正则化与优化参数1. 基础正则项reg_alpha 0.1L1 正则化reg_lambda 1.0L2 正则化XGBoost 库默认损失函数为 MSE均方误差。2. 结构正则剪枝与复杂度控制gamma分裂最小增益节点分裂必须达到的最小收益阈值值越大越难分裂是 XGBoost 原生的剪枝参数gamma0 时只要有增益就会分裂。min_child_weight叶子节点的最小样本权重和限制叶子节点规模抑制噪声避免单棵树过拟合。3. 其他常用优化参数colsample_bytree 0.8每棵树的列采样比例。min_child_weight 5叶子节点最小样本权重阈值。四、模型多样性来源差异随机森林多样性核心来自随机特征选择 样本有放回采样。GBDT / XGBoost多样性核心来自每一轮拟合的残差不断变化在此基础上额外搭配行采样、列采样能进一步提升多样性与泛化能力。