时序预测在过去几年一直是「一个数据集训一个模型」的脏活累活。每条业务线、每类传感器、每个地区,都要单独维护一套参数。基础模型把这条路堵上之后,大家真正关心的是两件事:在从未见过的数据上能不能直接出预测,以及许可证允不允许商用。IBM 在 9 月 9 日发布的 Granite Time Series PatchTST-FM-r2 同时回应了这两点。

模型本体:385M 参数 + conformer 块

PatchTST-FM-r2 沿用 patch 化表征,这是 PatchTST 系列高效的关键。但内部结构从标准 Transformer 层换成了 conformer 层:每块里,多头自注意力两边各夹一个半步前馈,中间再加一层时间卷积。自注意力负责跨 patch 的长程依赖,卷积负责 patch 内部的局部结构,两者职责分开。骨干由 20 层扩到 30 层,patch 用 50% 重叠 + Hamming 窗加权,配合 overlap-and-add 预测来平滑 patch 边界。最终模型约 3.85 亿参数,支持最长 8192 步上下文,预测头一次输出 99 个分位数,既能给点预测也能给区间估计。

GIFT-Eval 上的位置

GIFT-Eval 是目前覆盖最广的零样本时序基准。截至 9 月 8 日,PatchTST-FM-r2 在「replicable、严格零样本」类别里 CRPS 几何均值 0.467、MASE 几何均值 0.6846,排名第二,仅次于 TimesFM-3。考虑到 TimesFM-3 是 Google 的非商用许可,PatchTST-FM-r2 实际上是「宽松商用许可证」类别里的第一名。即便把那些允许拿 GIFT-Eval 训练集做预训练的「pretrained」模型也拉进来比,它仍然排在 CRPS 第三、MASE 第四,优于 Chronos-2、Timer-S1 和 Toto 几个变体,而它的参数体量比它们小很多。

训练数据:可审计的四个来源

IBM 把预训练语料拆得很清楚:GiftEvalPretrain 的部分数据、KernelSynth 改版周期核的合成数据、按 Chronos 路线生成的 TSMixup 语料(严格剔除 GIFT-Eval 评测集)、约 50 万条长度 4096 的合成 CauKer 序列。整套数据列表公开,而不是只甩一句「我们用了大量数据」。

许可证与生态:门槛降到最低

PatchTST-FM-r2 同时以 Apache 2.0 和 OpenMDW 1.0 双协议开源,企业可以在两者中任选其一。代码、权重、推理流水线全部在 GitHub 的 granite-tsfm 仓库和 Hugging Face 上,推理代码兼容上一代 PatchTST-FM-r1 的检查点。Confluent 那边,IBM 已经在 Flink on Confluent Cloud 的 Early Access 中接入了 PatchTST-FM-r1、FlowState-r1.1、TTM-r3 和 TSPulse,把基础模型直接搬进流式应用。

一段话总结

PatchTST-FM-r2 不是又一次「榜单刷分」。它把时序基础模型的可商用门槛打到了 Apache 2.0、把架构改动从论文里搬到了开源代码、再加上 conformer 块这种「语音模型跨界来」的实操细节。对于要在生产里跑预测、又不愿意被许可协议卡住脖子的团队,这是当下为数不多能直接拿来用的选项。