Cloudflare 在 AI 圈是 Workers AI 的算力服务商,而 2026 年 10 月 1 日的 Birthday Week 上,他们突然把身份往前挪了一步:发布首款自训练决策模型 Clef 与轻量版 Clef-flash,Apache 2.0 开源到 Hugging Face。决策模型是过去几个月新冒出的一个细分赛道——Typesafe 的 Jev 把「分类器不再需要为每个新类别重训」做成了产品,让 AI agent 在需要做选择题时不用去调一个庞大的通用 LLM。Cloudflare 的 Clef 直接瞄准这个赛道,而且拿出了比 Jev 更激进的数字。

从 Qwen 出发,做非自回归的 schema-bound 打分

Clef 和 Clef-flash 的基座都是开源 Qwen——Clef 用 Qwen3.8-27B,Clef-flash 用 Qwen3.5-9B。Cloudflare 把 Qwen 的权重全部冻结,只额外训练一个很小的「联合 schema head」(一个小型 transformer),同时配合 rank-256 的 LoRA 适配器。推理时,模型先做一次 prefill,然后用这个 schema head 在所有合法选项之间并行打分——而不是像普通 LLM 那样一个字一个字生成中间文字再 parse 成结构化结果。这意味着 Clef 没有「自由文本生成」,而是把 schema 当作骨架,直接把每个候选项的概率一次性输出。

论文级的技术细节都藏在 Cloudflare Blog 的训练方法段:他们用了标签平滑交叉熵 + Brier 损失来校准概率,还在这篇博客里首次披露了一个叫 RLCD (Reinforcement Learning for Calibrated Decisions) 的自创方法——一种专门为决策模型设计的强化学习目标,给相邻的 ordinal 选项部分奖励,对完全精确的输出给满分,并用参考惩罚避免分布漂移。这是 Cloudflare 第一次把 RL 用在「概率校准」上,而不是常规的 RLHF 优化回答质量。

跑分与延迟全面压制 Jev

Cloudflare 在 43 项 Jev Decision Index 跑分上,把 Clef、Clef-flash、Jev、DiffusionGemma Jev、Kev-9B 和 Laya 全部跑了一遍。Clef 在 ToolRet、BANKING77、CLINC150+OOS、PhishNChips 等近半数基准上拿到最高分,其余多与 Jev 互有胜负;Clef-flash 因为更激进地优化 latency,在 BFCL、API-Bank、MMLU、ARC-Challenge、HellaSwag、SATA-Bench 等更多子项上拿下第一。Clef-flash 的中位延迟只有 38.8 毫秒,比 Jev 的 524.1 毫秒快 13 倍以上;Clef 自己是 209.3 毫秒,仍然比 Jev 快一倍多。

Clef 还配了一个 Qwen 原生就有的视觉编码器,可以同时处理图像和视频输入,Jev 目前只支持文本。上下文窗口也给到了 64k,是 Jev 32k 的两倍。整套 API 兼容 Jev/SystemOne,所以现有基于 Jev 的代码可以零修改切换到 Clef,只换 endpoint 即可。

配套上新的 RL 微调平台

Clef 不只是模型。Cloudflare 同步发布了他们的新 RL 产品:先用 Cloudflare AI Gateway 抓取所有经过你账户的 AI 请求作为训练数据,Workers AI 用来跑 rollout,Cloudflare Containers 做 RL sandbox 评分,新的 Trainer 更新权重,最后用 BYO Model 部署回 Workers AI。这个闭环走的是 Cloudflare 自己的现有基建——AI Gateway、Containers(收购自 Replicate 之后的 Cog 工作)——所以客户不需要自己搭任何后端。起步阶段是 Cloudflare 的前向工程师(FDE)团队手把手合作,之后会开放自服务。

个人判断:Cloudflare 的「agent cloud」战略在这里落地了

Cloudflare 的 CEO Matthew Prince 这两年反复说 Cloudflare 要做「agent cloud」,把 Workers AI、AI Gateway、Containers、Access 这些产品线串成一个 agent 友好的边缘基础设施。这次 Clef + RL 平台其实是把这条战略落到了模型层:Cloudflare 不再只是卖 GPU 算力,而是要拿到企业用自家数据 fine-tune 决策模型的全栈能力。配合他们自己多年沉淀的网络数据(Cloudflare 提到有 15 年跨域标签数据可用于训练 Trust & Safety 分类器),这种垂直整合的能力,大厂和初创公司都很难拼。

更深一层的信号是「决策模型」这个赛道才刚冒头两个月,就已经同时有 Typesafe Jev、DiffusionGemma、Cloudflare Clef / Clef-flash、Kev-9B、Laya 等五家产品共存,而且其中三家是互联网基础设施工厂——这说明市场对「小、快、可控、不抽风」的需求正在快速增长,LLM 这种大而通用、不可预测的形态在 agent 的「决策节点」上越来越不顺手。Clef 把 Qwen 当基座也再次印证了之前的观察:中国开源基础模型已经在支撑得起「边缘模型」和「小模型场景化创新」的格局——海外大厂和初创都在用 Qwen 当后厨的料。

所以呢:如果你是 agent 开发者,Clef 现在的硬指标(速度 13 倍快、跑分基本压制、Apache 2.0 开源、API 兼容 Jev)意味着今天就能把它当作 Jev 的替代品试起来,而不必等生态慢慢长大;如果你是企业 AI 决策方,Cloudflare 这套 RL 微调闭环可能是接下来几个季度里最值得认真评估的「垂直决策模型」基础设施之一——不是因为它技术最强,而是因为它把「企业私有数据 + 边缘推理 + 模型微调」打包到了一家公司里。