表格数据是企业里最常见的业务形态,却是基础模型浪潮里最被冷落的一块。9 月 16 日,Stable AI 把 LimiX-2 的权重和推理代码开进了 GitHub 仓库:4 亿参数的预训练模型,一次前向完成分类、回归、缺失值插补三类任务,不需要针对下游任务更新任何参数。论文挂在 arXiv:2609.17488,当天冲上 Hugging Face Daily Papers 榜首。

三大基准全部第一,含金量在对手

官方跑分是这次发布最硬的部分。TabArena 总榜 Elo 1935,领先第二名 TabFM+ 117.4 分,聚合胜场约为对手 3.6 倍;TALENT 1506,领先 35 分,五个类别全部第一;BCCO 1432,对 AutoGluon 1.6 和 TabFM 分别领先 56、63 分。分类子榜 38 个数据集胜率 94.5%,回归子榜 13 个 96.9%。

参照系不是凑数:AutoGluon 1.6 是亚马逊的 AutoML 系统,TabFM、TabPFN-3、EXAONE Tabular 是表格基础模型赛道的主要玩家,CatBoost 是梯度提升阵营的底线。单一预训练模型把这些方法整体压在身后——TabArena 榜上 TabPFN-3 落后三百多分。

把"预测目标列"换成"学机制"

核心改动在建模对象。此前表格基础模型大多围绕 p(y|x, D_context) 组织——给特征、预测目标列,本质是"指定考题"式训练。LimiX-2 采用 CMN(Contextual Mechanism Network)范式,转向学习 p(x, y | D_context):整张表的联合生成结构是学习目标,任何变量都可从其余变量推断。

落到预训练上是 CCMM:同一张表在不同观测模式下遮住不同变量,裂变成大量条件预测问题。训练数据全部来自结构因果模型(SCM)合成,不依赖真实表格语料。附带产物是因果感知——特征注意力编码直接因果关系,可用于因果骨架恢复,超出"预测"的范畴。

4 亿参数远不是上限

scaling 部分可能是最值得盯的信号。团队评估了 12.5M 到 406.2M 的五条参数系列,下游性能随规模呈清晰的 log-linear 趋势,测量范围内没有饱和迹象。TabArena 上每翻倍参数量 Elo 提升约 34.7 分,R² 达 0.98——曲线还远没走到头,更大的模型仍有稳定收益。

工程侧:推理代码 pip 可装(Python 3.12 + PyTorch 2.9.1),支持 CPU 与 GPU;checkpoint 已放上 Hugging Face,仓库两天攒下 4.2k star、304 fork。

该泼的冷水:许可证与自报跑分

两点要冷静。其一,权重采用 StableAI LimiX Non-Commercial License,非商用;代码协议虽以 Apache 2.0 为底,但追加了署名与模型命名条款,上生产前先看清。其二,上述跑分均为官方自报,第三方独立复现还没有出现,"全部第一"当前只能以官方口径对待。

意义在路线本身:语言模型跑通"预训练 + 免微调"之后,第一次有团队用 scaling law 指引着把同样的范式推到表格三榜第一,并明确展示了未饱和的外推空间。企业里最重的活从来不是写诗,而是表格——这条赛道若继续按 log-linear 兑现,AutoML 四小时调参的默认地位未必保得住。

参考:arXiv:2609.17488 / github.com/limix-ldm-ai/LimiX / huggingface.co/stable-ai/LimiX-2