大模型热搜第一,企业后台还在跑一片“林子”

发布时间:2026/10/2 12:54:43
大模型热搜第一,企业后台还在跑一片“林子” 2026 年,大模型发布会一个接一个。上下文更长、多模态更全、API 更便宜,技术社区的讨论几乎被生成式 AI 占满。但把视角切到银行风控、保险核保、电商反刷单、工业设备预警这些系统后台,会发现另一件事:很多核心预测任务,仍然由一片“林子”在完成。不是比喻。是随机森林(Random Forest)。一、为什么表格数据不爱换模型企业里最常见的数据,不是文章、图片、视频,而是表格:用户年龄、城市、设备、历史交易笔数设备温度、转速、振动幅度、停机次数保单渠道、免赔额、理赔次数、医院等级这类数据有几个共同特点:特征有业务含义样本量不一定大噪声多、缺失多、口径乱预测结果要能解释给监管/客户/老板听在这种场景下,随机森林的优势不是“最准”,而是够准、够稳、够便宜、够好懂。Breiman 2001 年提出随机森林后,它长期是表格数据建模的默认基线。二、随机森林到底在干什么两句话就能说清:对训练集做多次有放回抽样,得到很多子集每个子集训一棵决策树,预测时分类投票、回归平均核心公式只有两个。分类:$$\hat{y}(x)=\arg\max_c \sum_{k=1}^{K}\mathbb{I}\big(T_k(x)=c\big)$$回归:$$\hat{y}(x)=\frac{1}{K}\sum_{k=1}^{K}T_k(x)$$每次 Bootstrap 抽样时,某个样本没被抽中的概率是:$$\left(1-\frac{1}{n}\right)^n \to \frac{1}{e}\approx