9 月上旬,agent 赛道又多了一个大动作:Nex AGI 把新一代模型家族 Nex-N2.5 一次性放出三档——mini、Pro、Max。主角是 Max:1.6 万亿参数的纯文本 MoE,官方称之为「我们首次在万亿参数尺度上完成的完整后训练」。三档权重全部开放,Hugging Face、ModelScope 都能下载,mini 和 Pro 还接入了 OpenRouter 托管服务。
视觉不是输入,是接口
Nex-N2.5 冲的是长时程真实环境任务:操作电脑、浏览网页、自主写程序并跑测试。mini 和 Pro 延续上一代 Nex-N2 的多模态底座,重点强化 computer use、网页浏览与视觉接地的 agent 能力。官方 README 有句值得划线的表述:视觉不再只是一种输入模态,而是 agent 感知环境、验证结果、推动任务的「关键接口」——模型要看屏幕做事,做完看结果自我纠错,反馈闭环靠视觉完成。
跑分:单项反超,整体追赶
官方评测把三档与 Claude Opus 5、GPT-5.6 Sol、Kimi-K3、GLM-5.3、DeepSeek-V4-Pro、Qwen3.8-Max 同表对比。亮点:Max 在 BrowseComp 拿 92.6,压过 Claude Opus 5 的 90.8、GPT-5.6 Sol 的 90.4 与 Kimi-K3 的 91.2,为该表最高分;Pro 在 OSWorld-G 拿 87.4,超过 Qwen3.8-Max 的 84.9 和 Claude Opus 5 的 76.8。短板同样明显:Terminal-Bench 2.1 上 Max 为 86.1,落后 Opus 5 的 89.1;SWE-Bench Pro 上 65.7 对 79.2。一句话总结:单项能赢前沿闭源,整体仍在追赶。
部署门槛:万亿参数不白给
参考部署配置里,Max 要 2 节点共 32 张 H200(官方定制 SGLang fork 的 Docker 镜像,262144 上下文);Pro 降到单节点 8×H100;mini 两张 H100 就能起服务。模型提供 reasoning_effort 三档思维模式(关闭/自适应/强制思考),工具调用解析器兼容 qwen3_coder。许可方面,多家第三方追踪源确认三档均为 Apache-2.0。
所以呢
看点不在「又一组开源权重」,而在万亿 MoE 的完整后训练流程被这家公司走通之后,连评测口径、部署命令、思维模式开关都一并公开——agent 原生训练又多了一份可对照的公开样本。对应用团队,mini 两卡可跑、OpenRouter 直接可试,试错成本已压到地板;值得盯的下一个问题是:靠视觉反馈自我纠偏这套训法,能不能下放到更小的模型上?
完整评测表与部署命令见官方仓库:https://github.com/nex-agi/Nex-N2.5