一个没有公司名、没有新闻稿、没有 logo 的模型,8 月 20 日悄悄出现在 OpenRouter 的目录里,代号 stealth/ox-alpha。它免费开放一周(到 8 月 27 日前后),提供 1,048,576 token 的上下文窗口,支持文本、图像、视频输入,最大输出 131,072 token,还带函数调用和结构化 JSON 输出——匿名提供方声称自己有每天 100 万亿 token 的服务容量。开发者蜂拥而至,但很多人没细看的一行字是:你的每一条 prompt 和补全,都会被提供方保留。(TechTimes 报道)

免费的代价,藏在两份打架的条款里

模型页上写得看似安心:prompts 和 completions 被"保留但不用于训练"。但管辖所有 stealth 模型的 OpenRouter Stealth Model EULA 是另一套说法——它授予 OpenRouter 和匿名提供方将用户内容用于训练、评估和改进的权利,并明确说:不想要这种用法的用户,请直接不要访问 stealth 模型;输入中的个人数据会被发送给提供方。平台没有公布任何材料解释这两份文件如何调和,TechTimes 的结论是:通过 OpenRouter 直连端点发送的任何 prompt,其训练权问题没有被干净地解决

更微妙的是,同一个模型有两条路由、两套政策:OpenCode 平台上的 Ox Alpha 路由标注零保留、不用于训练——但那同样是一个身份和司法辖区都未知的匿名提供方。同一个模型,换一条入口,数据政策就变了,这对任何打算往里喂敏感代码的团队都应该是红灯。

指纹侦探:三天锁定疑似幕后

社区在几小时内就开始了取证。到 8 月 22 日,证据链已经从猜测升级到服务层证据:研究者对 Ox Alpha 跑了 30 条覆盖 14 种文字系统的探针,token 计数与 GLM-5.3 全部匹配,每条请求固定多出 75 个 token——那是系统提示词或路由包装的痕迹;视频编码器的 token 消耗模式与智谱自家的 GLM-5V-Turbo 在三个独立设计选择上同时吻合(约每秒 147 token、帧率无关采样);有人故意发一个格式错误的请求,服务器抛出的 Java 堆栈直接暴露了内部类名,该包路径映射到智谱 open.bigmodel.cn / api.z.ai 的 API 路由;错误码方言也对得上 Z.ai。研究者的运营层置信度给到 0.98——但智谱和 OpenRouter至今都没有官方确认,严谨的说法仍然是"最可信的理论,而非定论"。(AgentBreaking 复盘)

这也不是第一次。TechTimes 统计这是 OpenRouter 六个月内的第五个 stealth 模型,前四个(GLM-5、小米 MiMo-V2-Pro、蚂蚁 Lingxi Ling-2.6-flash、美团 LongCat-2.0)最终都被开发方认领。匿名发布让模型在被测时摆脱品牌偏见,实验室换来真实世界压力测试数据和官宣时现成的用户盘——"免费换数据"这门生意的账,算得很清楚。

跑分很香,样本很小

开发者 Ben Davis 在 DeepSWE(真实软件工程任务评测)上测出 10 题过 8、80% 通过率,同一组任务 Claude Fable 5 是 65%、GPT-5.6-Sol 是 52%。但这是单人跑的 10 任务小样本,不是审计过的榜单——10 题规模下一道题就能撬动 10 个百分点。另一边 Day.dev 的 Kingbench 测试里 Ox Alpha 是 87.5%,反而落后 GLM-5.3 的 91.25%。OpenRouter 监控显示上线约 24 小时处理了超 1600 亿 token,头部消费者是 Claude Code、Hermes Agent 这类 agent 工具,缓存命中率 73.5%——代理式编码工作流显然是它的主场。

所以呢

对非敏感输入做能力评估,这个免费窗口是难得的机会;但把私有代码库整个塞进一个 1M 窗口之前,先回答一个问题:你愿意把代码发给一个无法具名的第三方,且训练权条款自相矛盾、司法辖区未知的端点吗?多数企业安全政策的答案,在数据出门之前就写好了。免费的模型不收费,但你的 prompt 就是价格。