2026 年 10 月 1 日,Perplexity 把自己的第一个决策模型放上了 Hugging Face:pplx-decider-v1-27b,Apache 2.0 协议,权重 26B。一家以搜索起家的公司,入场位置不是又一个通用大模型,而是智能体工作流里最不起眼也最烧钱的一环:做决定。

决策模型是什么

按 Cloudflare 在同期发布里的解释,决策模型做的事是分类与判断:输入一段客服消息,输出带概率的类型化答案——是否紧急、该哪个团队处理,代码直接拿去路由、升级或转人工。它和 LLM 的分工在于:LLM 开放生成但非确定,决策模型输出有界、便宜、快、稳定。这个品类由 Typesafe AI 的 Jev 带火,Cloudflare 直言市场已经「越来越饱和」——一周之内,Fastino 的 GLiDE、Cloudflare 的 Clef、Perplexity 的 Decider 相继亮相,迭代速度以周计。

成绩单:总评压 Jev,赢在检索真值

官方模型卡给出了 11 项基准的对照:总评 85.71%,略超 Jev 的 84.51%,大幅超过底座 Qwen3.8-27B 的 74.76%。细看单项更有意思:Decider 赢在 RAGTruth(88.80% 对 77.27%,领先逾 11 个百分点)、FinancialPhraseBank、TabFact、Circa 这类「给定材料做判断」的题;Jev 则守住 WinoGrande、BBH、JudgeBench、TruthfulQA 和自家 JevBench。一家搜索引擎公司微调出的模型,最强的恰好是检索真值判断——数据基因藏不住。需要说明:这些数字由 Perplexity 通过自家 API 测得并公布,属自报成绩。

开源,但有门槛

Decider 支持 choice、noul 两类输出,返回校准过的概率,还能直接吃图片做视觉判断。但 26B BF16 权重就需要约 49 GiB 空间,还要另加工作内存,CUDA 环境、Python 3.12 起步;模型卡页面显示的月下载量还只有 165。换句话说,这是给有显卡的工程团队准备的组件,不是拿来即用的 API 替代品。

所以呢

决策模型正在变成智能体栈里的独立一层:路由、分类、护栏这类高频小判断,不必每次都请示前沿大模型。Perplexity 的入场说明两点:第一,搜索公司攒下的判断类数据能直接换成模型优势;第二,这个品类的窗口期不会太长,等 API 巨头把决策能力打包进平台,开源权重的差异化就是入场券。做智能体的团队现在可以问自己一个问题:你的工作流里,有多少次大模型调用其实只是在做一道选择题?模型卡见 Hugging Face。