从「堆硬件」到「卖Token」:算力行业正在换一种方式算账
如果过去三年的算力故事,主线是「谁手里有 GPU」,那么 2026 年下半年这条主线被改写了。「Token 工厂」这个原本只在大模型公司内部出现的词,正在被算力服务商拿过去当招牌。
7 月 29 日晚,行云科技发布公告,旗下深圳行云与某深耕长上下文、自有大模型底座的头部客户(VB 客户)签订算力服务补充协议:算力服务单元数从 128 个翻倍到 256 个,5 年合同总金额由约 10 亿元调整至 30.53 亿元,涨幅 201.14%;同时,在原有固定服务费之外,新增了一项**「按 Token 收入相关的固定服务费」**——而且不管客户实际 Token 业务收入涨跌,这一项服务费都不调整。
这不是个例。上海证券报梳理发现,2026 年以来,已有润建股份、弘信电子、行云科技、超讯科技、南威软件等 10 多家上市公司宣布探索「Token 工厂」业务。行情不是「硬件涨价」能概括的,而是整个计费逻辑在切换。
同一份合同,出现了「Token 分成」这种新条目
行云科技这份补充协议值得拆开看。
原来合同是经典的「卖资源」:128 个算力单元 × 单价 × 5 年 = 10 亿元。补充协议变成了三层:
- 第一层,固定单元费——每单元每月的算力服务费相比原合同涨 21.21%;
- 第二层,扩容单元费——剩余 120 个单元 + 新增 128 个单元,每单元每月固定服务费相比原合同涨 36.36%;
- 第三层,Token 收入固定服务费——只要客户继续按月验收这些算力单元,客户就要付这笔钱,与实际 Token 收入不挂钩。
看似不挂钩的设计,实际上是把「客户用我的算力到底赚了多少」直接写进了收费模型里。固定服务费的形式给算力方吃下「客户做不出 Token」的不确定性,但「按 Token 收入相关」这个定义又锁定了未来若客户业务跑得更好时的期权价值。
行情人士对此的解读很直白:TaaS(Token-as-a-Service)模式最核心之处在于算力企业与大模型企业进行 Token 分成,大模型企业的 Token 溢价通过分成模式带动「Token 工厂」的收入。一句话,卖资源是一锤子买卖,卖 Token 则是把算力方的利益跟模型方的爆款能力绑在一起。
「Token 工厂」三件套:调度、推理优化、华为/国产算力底座
「Token 工厂」不是噱头,是技术栈的总和。
行云科技董事长张文最近给行业分了代:1.0 是「卖设备」、2.0 是「卖资源」、3.0 是「系统综合能力决定胜负」。落到具体公司:
- 润建股份:推出「星算云池」,联合互联网大厂生态合作伙伴,五象云谷智算中心将升级为「Token 工厂」;
- 超讯科技:5 月 13 日与广西南一智能签约,联合共建「Token 工厂」,涵盖算力租赁、调度、套餐三类服务;
- 弘信电子:以华为超节点算力集群为首期基础设施,在无锡建一座「Token 工厂」;
- 南威软件:北京七星园智算中心定位为大型「Token 工厂」,拉动 Token 经济。
从拼凑的描述可以归纳出共同点:底层是国产/非美系算力集群,中层是算力调度系统,上层是按 Token 计量和分成的服务接口。MaaS(模型即服务)时代,这三层都是模型公司自己扛;TaaS 时代,调度与计费被算力方接手,模型公司只管把 Token 吐出来。
为什么是现在:Token 消耗千倍增长,MaaS 让位 TaaS
中国工程院院士郑纬民在 4 月的论坛上给过一个关键数据:我国 Token 消耗两年实现千倍级增长。这个增速让两件事同时发生:
- 大模型公司突然需要长期、稳定的算力合同,而不是临时找卡;
- 算力公司发现,只要把「Token 出货量」当作服务等级协议(SLA)的核心 KPI,议价权会比单纯按卡时高得多。
这正是 TaaS 模式在 2026 年下半年集中爆发的产业基础——Token 变成了一种可以被打包、调度、分成的「电力单位」,算力公司开始变成「Token 发电厂」。
一位算力产业链人士的判断更直接:现在很多高端算力服务合作出现交付难,核心原因是多数服务方拿不到足够的高性能算力服务器;谁能拿到,谁就拥有提价和签长约的话语权,下游大厂为了保障供给也愿意接受提价。这是一段「硬件供给紧张 + Token 需求暴涨」叠加的窗口期,TaaS 借着这个窗口把合同结构改写。
算力行业的「Token 工厂」,能撑多久?
「Token 工厂」模式的风险也很清晰。
第一,锁定的不是客户,而是客户的爆款能力。 行云科技补充协议里,虽然 Token 收入相关服务费「不因实际收入增减而调整」,看似对算力方有利,但若客户业务跑不出来,长期续约和扩单的概率会下降,5 年 30.53 亿的合同价值高度依赖 VB 客户的长文本模型商业化能力。
第二,头部模型公司未必愿意把 Token 收入分给算力方。 真正的大型基础模型公司(自研底座 + 自有渠道)在 Token 议价上有足够强的能力,它们更可能选择自建/绑定单一算力供应商,而不是按 Token 收入与算力方分成。「Token 工厂」目前主要客户是长文本、超大上下文这类专项模型公司,而不是全行业通用大模型。
第三,Token 计量和定价缺乏标准。 不同模型的 Token 长度、计费策略、缓存命中率差异极大,「每瓦 Token 生产效率」作为竞争指标听起来酷,但跨模型、跨集群比较没有统一口径。行情未来一定会出现「Token 单价」基准之争。
所以呢:TaaS 不是新概念,但它正在被写进合同
把视野拉高一点,「Token 工厂」的本质是把算力从资本品(算力服务器)转成了消费品(API 调用量)。
过去 IDC、CDN 行业也走过类似的路径——从卖机柜、卖带宽,过渡到按 QPS、按流量计费,催生了 Cloudflare、Akamai 这类以「用量」为核心的边缘服务商。今天算力行业在 LLM 时代重走这条路:从「我有 H100 / 昇腾」,过渡到「我每分钟能稳定吐多少 Token」。
从行云科技、润建股份、超讯科技、弘信电子、南威软件这一波动作来看,国内算力服务方已经集体意识到:未来三年的护城河不在 GPU 数量,而在调度系统和 Token 计量能力。接下来 12-18 个月,真正能跑出来的「Token 工厂」,会跟现在还停留在「我有 N 个机柜」层级的算力公司,拉开一个量级的差距。
合同里那条「Token 收入相关固定服务费」,就是这个时代切线的真实落点。