2026 年,大模型发布会一个接一个。上下文更长、多模态更全、API 更便宜,技术社区的讨论几乎被生成式 AI 占满。
但把视角切到银行风控、保险核保、电商反刷单、工业设备预警这些系统后台,会发现另一件事:
很多核心预测任务,仍然由一片“林子”在完成。
不是比喻。是随机森林(Random Forest)。
一、为什么表格数据不爱换模型
企业里最常见的数据,不是文章、图片、视频,而是表格:
- 用户年龄、城市、设备、历史交易笔数
- 设备温度、转速、振动幅度、停机次数
- 保单渠道、免赔额、理赔次数、医院等级
这类数据有几个共同特点:
- 特征有业务含义
- 样本量不一定大
- 噪声多、缺失多、口径乱
- 预测结果要能解释给监管/客户/老板听
在这种场景下,随机森林的优势不是“最准”,而是够准、够稳、够便宜、够好懂。
Breiman 2001 年提出随机森林后,它长期是表格数据建模的默认基线。
二、随机森林到底在干什么
两句话就能说清:
- 对训练集做多次有放回抽样,得到很多子集
- 每个子集训一棵决策树,预测时分类投票、回归平均
核心公式只有两个。
分类:
$$\hat{y}(x)=\arg\max_c \sum_{k=1}^{K}\mathbb{I}\big(T_k(x)=c\big)$$回归:
$$\hat{y}(x)=\frac{1}{K}\sum_{k=1}^{K}T_k(x)$$每次 Bootstrap 抽样时,某个样本没被抽中的概率是:
$$\left(1-\frac{1}{n}\right)^n \to \frac{1}{e}\approx