
LightGBM 在大数据集上训练时内存耗尽怎么排查【免费下载链接】LightGBMA fast, distributed, high performance gradient boosting (GBT, GBDT, GBRT, GBM or MART) framework based on decision tree algorithms, used for ranking, classification and many other machine learning tasks.项目地址: https://gitcode.com/GitHub_Trending/li/LightGBM用 LightGBM 训练大数据集时最常见的内存相关现象是机器内存被耗尽runs out of RAM。官方 FAQ 针对这一现象给出了几个可以直接调整的参数入口限制直方图缓存大小histogram_pool_size、降低num_leaves、降低max_bin见 docs/FAQ.rst 的 “When running LightGBM on a large dataset, my computer runs out of RAM” 一节。配合 docs/Parameters.rst 中各参数的适用条件和 docs/Python-Intro.rst 的内存高效用法可以按“先定位内存去向、再逐项收窄”的路径把训练控制在可用内存内。先把内存去向分成三类LightGBM 的内存消耗来自不同环节官方文档给出的对策也分别对应不同环节排查时先判断自己属于哪一类数据文件本身放不下内存。默认情况下 LightGBM 会把数据文件映射到内存中再从内存加载特征docs/Parameters.rst 明确说明这样加载速度快但“当数据文件非常大时可能引发 run out of memory error”。这类问题对应two_round参数。训练过程的结构内存直方图缓存、树结构、Dataset 对象。对应histogram_pool_size、num_leaves、max_bin、force_col_wise等参数。Python 侧的原始数据对象。LightGBM 的Dataset对象只保存离散 bin很省内存但 Numpy/Pandas 原始对象本身很占内存如果不显式释放训练期间会一直驻留见 docs/Python-Intro.rst 的 “Memory efficient usage” 一节。数据文件太大启用 two_round如果数据集是直接以文本文件形式传入CLI 的data xxx或 Python 的lgb.Dataset(xxx.txt)把two_round设为true# 适用于数据文件太大、无法整体放进内存的情况 # 别名two_round_loading / use_two_round_loading two_round true仓库自带的示例配置 examples/binary_classification/train.conf 中也包含这一项其注释说明了使用边界“when data is bigger than memory size, set this to true. otherwise set false will have faster speed”即数据放得下内存时保持false加载更快。适用条件来自 docs/Parameters.rst仅在使用two_roundtrue时有效且只适用于直接加载文本文件的场景数据放得下内存时不建议开启因为默认的文件内存映射加载速度更快。收窄训练过程内存四个参数以下参数的默认值、类型和说明均取自 docs/Parameters.rst。histogram_pool_size限制直方图缓存默认-1.0 0表示不限制设为正数即限制 LightGBM 历史直方图缓存的上限单位为 MB。FAQ 给出了估算公式可作为设定依据histogram_pool_size dataset size ≈ RAM used。可以先按机器可用内存反推出能分配给直方图的 MB 数再填入该参数。示例值需按自己的内存反推以下为占位写法# 单位 MB设成希望分配给 LightGBM 直方图缓存的内存量 histogram_pool_size 你估算的MB数num_leaves 与 max_bin降低结构规模num_leaves默认31每棵树的叶子数上限。FAQ 建议内存不足时调低它。max_bin默认255特征值分桶的最大 bin 数。降低它可减少每棵树需要评估的分裂点进而省内存。文档同时提醒bin 数偏小可能降低训练精度但可能提升泛化能力缓解过拟合。LightGBM 会按max_bin自动压缩内存例如max_bin255时使用uint8_t存储特征值见 docs/Features.rst 关于直方图算法降低内存的描述。force_col_wise切换直方图构建方式force_col_wisetrue强制使用列式直方图构建。docs/Parameters.rst 列出的推荐启用条件包含“you want to reduce memory cost”另外两个条件是列数很大或总 bin 数很大、num_threads较大例如大于 20。仅用于cpu设备类型。与之相对force_row_wisetrue会加倍Dataset 对象的内存开销文档原话是内存不足时应改用force_col_wisetrue。这两个参数不能同时使用。组合示例具体数值需按实际内存调整num_leaves/max_bin取低于当前值# 用于减少内存开销仅 cpu 设备类型有效 force_col_wise true # 降低单棵树叶子数上限默认 31 num_leaves 31 # 降低分桶上限默认 255调小可能降低精度但增强泛化 max_bin 128Python 包训练释放原始数据如果用 Python 包传入 Numpy/Pandas 对象docs/Python-Intro.rst 的 “Memory efficient usage” 给出三步省内存做法import gc import lightgbm as lgb # 1. 构造 Dataset 时保持 free_raw_dataTrue默认值即为 True train_data lgb.Dataset(data, labellabel, free_raw_dataTrue) # 2. Dataset 构造完成后显式置空原始数据引用 train_data.raw_data None # 3. 调用 gc 回收 gc.collect()说明Dataset对象本身只保存离散 bin内存开销小占用大头的是构造前的 Numpy/Array/Pandas 对象上述步骤就是把这些对象从进程里拿掉。可选分支如果数据量大到连原始对象都不宜整体载入可以用lgb.Sequence接口按批构造 Dataset逐批读取、节省构造Dataset时的内存完整示例见 examples/python-guide/dataset_from_multi_hdf5.py。验证与权衡事前估算FAQ 的公式histogram_pool_size dataset size ≈ RAM used可用于调整前估算总内存需求判断参数组合是否能放进机器内存。重跑训练参数调整没有改变数据与任务验证方式就是重新执行训练命令观察此前导致内存耗尽的阶段数据加载或直方图构建能否正常通过各参数本身在 docs/Parameters.rst 可查默认值用于确认自己改的是哪一项。精度权衡降低max_bin和num_leaves是 FAQ 给出的直接手段但文档明确max_bin调小“可能降低训练精度”应在内存放得下和模型效果之间自行取舍文档没有给出固定的推荐值。已知限制避免踩坑two_roundtrue只在直接加载文本文件时有效通过内存对象传入数据时该参数不适用文档指出linear_treetrue会“显著增加 LightGBM 内存使用”。如果当前任务启用了线性树linear_tree内存问题应先从这个选项评估而不是只调 bin 数内存不足时不要顺手开force_row_wisetrue——它会使 Dataset 内存开销翻倍文档建议的方向是force_col_wisetrue以上参数仅适用于当前单机 CPU/GPU 训练场景分布式训练的内存管理如 Dask worker 溢出到磁盘的行为属于另一个独立问题见 docs/Parallel-Learning-Guide.rst。完整参数清单见 docs/Parameters.rstFAQ 中该问题的原始条目见 docs/FAQ.rst “General LightGBM Questions” 第 3 条。【免费下载链接】LightGBMA fast, distributed, high performance gradient boosting (GBT, GBDT, GBRT, GBM or MART) framework based on decision tree algorithms, used for ranking, classification and many other machine learning tasks.项目地址: https://gitcode.com/GitHub_Trending/li/LightGBM创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考