"这条工单派哪个团队?""这条评论正面还是负面?"——软件问大模型的多数问题不是要文章,而是要一个决策:选项固定、答案落在集合里,最好带置信度。Privatemode(Edgeless Systems)上周发布的方法把这个场景压到极致:GLM-5.3-Flash 一次前向、一个 token,吐出完整决策。HN 上这条帖子已攒 133 分、58 条评论。

三个动作,零微调

做法拆开只有三步。第一,把状态、问题和编号选项打包进 prompt,要求模型用选项序号回答;第二,让 prompt 结尾停在答案位——直接预填 choice_index:,模型下一个 token 必然是某个序号;第三,不读模型生成的内容,改读它在这一位置给所有选项序号分配的概率,归一化后取最大者。

关键洞察:既然 JSON 的形状是我们自己定的,让模型生成整个 JSON 就是浪费——要的只是那个被约束住的"类型化判断"。全程不微调,用的就是官方原版 GLM-5.3-Flash。Jev(TypeSafe)和 Laya(Convai)是为决策专门训练的 System One 模型;Privatemode 的赌注是:通用 LLM 配上合适的采样姿势,不重训也能站上同一量级。

29 个数据集的战报

基准覆盖 29 个公开数据集,2 到 151 个选项,意图路由、情感、分类、蕴含、法律文本、扫描文档都有,英德双语。28 个文本数据集上,GLM-5.3-Flash 与 Jev 各赢 10 个、8 个差距在 1 个百分点内,中位差 0.7 个百分点偏向 Jev,统计不显著(p=0.64)。温度 0 下两次运行仍有最多 3.5% 漂移(批处理与浮点所致),更小差距都当噪声。

选项数量的影响比选哪个系统更大。TREC 上从 6 选项细化到 42 选项,Jev 从 92.1% 掉到 85.6%,GLM-5.3-Flash 从 91.2% 掉到 79.6%,Laya 从 88.4% 掉到 51.2%。

成本与延迟是诚实的:百万次决策 GLM-5.3-Flash 约 62 欧元、Jev 约 16 欧元,便宜四倍的是 Jev;从德国实测,前者 180 ms、后者 264 ms。边界也自曝:151 选项的 CLINC150 上它用两次请求拼出 87.5%(Jev 78.4%),但要 719 ms(Jev 249 ms);上限是 191 个选项——tokenizer 会把更大的数字拆成多 token。图像是专属能力:RVL-CDIP 1600 份扫描商务文档 16 分类,70.2%,Jev 与 Laya 都是纯文本模型无法作答。

标签噪声与推理的代价

两个发现值得单独说。其一,部分错误其实在标签里:banking77 约 17% 的样本两个答案都说得通(如 get_physical_card 与 order_physical_card),任何系统在该数据集的理论上限约 85% 而非 100%。其二,推理确实更准但按 token 计价:让同一个模型先推理再答,准确率全区间更高(89.9% vs 85.5% 到 82.0% vs 79.2%),代价是每次几百 token、百万次约 350 欧元——对比 62 欧元的单 token 方案,贵的不是模型,是"想一下"本身。

所以呢

这套方法的真正读者,是被专用决策模型挡在门外的人:一个 MIT 协议的 Python 库,配任何 vLLM 后端就能跑,换模型不用改代码。可复现性也罕见:基准方法学、冻结数据集、harness、聚合脚本全开源,博客里每个数字都能重算。下一个被"通用模型 + 推理工程"拉平的专用赛道会是哪个?评论区聊聊。