填一张网页表单,今天的通用 LLM Agent 要走多少步?Cua 团队给的参照数字是 23 轮、39.6 秒——截图、思考、调用驱动器、再截图。而他们刚开源的专用模型 CUA-S1-FORMS 做同一件事,只需要一次 50 毫秒的前向传播。

70 万参数的「系统一」模型

Cua(YC S25 团队)9 月 19 日开源了 CUA-S1 家族的首个模型 CUA-S1-FORMS。家族命名叫 System One Models:不做链式思考、不做多轮推理、不调云端 API,单个前向传播直接给出决策。CUA-S1-FORMS 只有 706k 参数,checkpoint 2.8MB,MIT 许可,权重发布在 Hugging Face 的 cua-ai/cua-s1-forms,CPU 上就能跑。

它只干一件事:表单决策。给定一组从文档里抽出的结构化字段和候选值,模型对每个表单元素预测四个动作之一——填入给定值、勾选、点击、跳过。所有元素的决策在一次前向里并行完成,执行顺序由调用方代码排好,交给 Cua Driver 逐个静默执行。它不预测新值,也不看截图。

架构:小到反直觉

第三方拆解给出的架构细节:两层、128 宽度的 transformer,4 个注意力头,直接读原始字节、不用 tokenizer。训练成本也轻得不像一次模型发布:第一版在合成数据上训练不到 30 分钟。

自报成绩与边界

官方 model card 自报:真实表单决策准确率 99.7%,作为对照的通用 LLM API 基线约 83.6%。注意这是官方自报数字,独立复现还没出现。能力边界同样明确:只在任务边界清晰、结构受限的场景成立,预测新值、理解截图这类开放任务它明确不做——这些仍留给大模型。

行业读法:小模型开始「分食」Agent 流水线

同期 Latent.Space 的 AI 周报提到,@ValsAI 发布的 CUA-Bench 上所有前沿模型在实时键鼠操控任务里得分都低于 20%——通用 Agent 在计算机操控这件事上远未饱和。这个背景下,CUA-S1 走的是一条反向路线:不把宝押在更大的通用模型上,而是把 Agent 流水线里「反射级」的子任务切出来,交给训练不到半小时的微型模型。前一天开源的 Needle 3(8-29MB 端侧工具调用模型)是同一叙事的另一个数据点。

对做企业自动化的团队,信号很具体:不是 Agent 的每个环节都值得挂一个千亿模型。把「值对齐」这类确定性子任务下沉到 2.8MB 的本地模型,延迟、成本、隐私三笔账同时改善。至于官方数字的成色,等独立评测说话。