9 月 28 日,法国 AI 公司 H Company 发布新一代 Agent 模型 Holo4:27B 稠密与 35B-A3B MoE 双版本(总参 35B、激活约 3B),基座 Qwen3.8-27B;同场的 Holotron4 Nano 是 Nemotron 3 Nano Omni 的同配方 Agent 改造版。

一个模型,四种接口

Holo4 的核心设计是「全接口通用」:同一个模型既能点击、输入、操控屏幕,也能写代码并运行,还能调 MCP 和 API 工具。官方指出,多数 Agent 模型只为单一接口训练:专注 GUI 的没屏幕就失明,偏好工具调用的碰上无 API 的应用就卡死,而真实任务常需混用。桌面、网页、Android、沙箱和业务 API 上都是同一个模型、同一种调用方式。

跑分逼近 frontier,成本砍到七分之一

按 H 公司自报数据,最难的桌面操控基准 OSWorld 2.0 上,Holo4 27B 拿 61.7 分(平均部分得分)、成功率 41.5%、单任务约 1.22 美元;对照 Claude Opus 5.5 的 81.8 分、48.7%、8.48 美元,GPT-6 Astra 的 73.5 分、9.07 美元。基座 Qwen3.8 27B 只有 48.0 分、3.49 美元,后训练增益肉眼可见。注意原版 OSWorld 是另一回事:短任务上 27B 拿 85.2、基座 84.3,差距小,真正拉开的是长流程。API 自动化基准 AutomationBench 上它拿 45.4 分、每任务 0.05 美元。

训练上先用 127B token 做监督微调,再训两个 RL 专家合并;任务来自「Agentic Task Factory」——仅凭文档自动构建可验证任务,已产出约 1 万个;harness 也重建:跨数百步的可靠记忆加桌面机上的 shell。官方 Pac-Man 演示可见 token 效率差距:Holo4 用 68 次调用、2.4M token 完成,基座要 197 次、11.4M。

泼冷水的三处

许可证分裂。 两个尺寸都开放权重下载(BF16、FP8、NVFP4、4-bit GGUF),但最强的 27B 是 CC BY-NC 4.0 禁商用;只有 35B-A3B 是 Apache 2.0,而它 OSWorld 2.0 只有 30.9 分。想自托管做商业产品,只能用分数减半的版本。

自报数字与训练集重叠。 所有分数出自自家 harness(完整轨迹开源在 trajectories.hcompany.ai 供回放,值得肯定);但 MarkTechPost 指出,AutomationBench 600 个公开任务里 480 个落在训练数据划分内,120 个保留任务上 27B 得 49.3。canberk.me 也提醒,85.2 与 61.7 是两种度量,不能混着宣传。

长任务差距仍是结构性的。 61.7 对 81.8 差 20 个点,成功率 41.5% 对 48.7% 也是硬差距——开源阵营第一次把成本打进 frontier 七分之一区间,但「便宜能用」和「可靠交付」之间还隔着这些数字。

所以呢

选型先看许可证再看跑分,这是 Holo4 最实际的教训。对行业,它把「轨迹全开源」立成 Agent 透明度新标准,给出 27B 级后训练逼近 frontier 的可复现样本;DSpark 加速 checkpoint 几天内跟进,推理优化可盯一眼。

参考:huggingface.co/blog/Hcompany/holo4;marktechpost.com;canberk.me;techaiwire.com