从调用别人模型,到自己拥有模型
Base44——Wix 旗下、ARR 1.5 亿美元的 vibe-coding 平台——在 7 月初悄悄交出了自己训练的第一款 LLM:Base 1。这件事本身在开源/前沿模型满天飞的 7 月并不起眼,但它指向了一个更值得讨论的趋势:当一个垂直场景足够「富」,平台方自己训一个模型的拐点已经到了。
Base 1 是什么
- 训练数据:数千万次真实的应用构建交互(用户描述需求→模型写代码→用户修改→再次生成),全部来自 Base44 平台内部。
- 定位:Vibe-coding 专用的 LLM,不是通用对话模型。它不试图跟 GPT-5.5、Claude Opus 4.8 比「世界知识」,它只比一件事——把一句自然语言变成一个能跑的全栈应用。
- 部署方式:内部 auto-routing 已经会根据内部 benchmark 胜出率把任务直接路由到 Base 1,而非外部 API。
- 战略意义:Base44 是第一个把「自己训的 vibe-coding LLM」作为产品卖点公开喊出来的平台(连 Bolt、Lovable、Replit Agent 都还停留在「接最强闭源 API」)。
为什么这件事值得拆
1. 数据飞轮。 Base44 的核心资产不是模型,是「用户在做 app 时怎么改、怎么回滚、卡在哪、最后交付什么」这数千万条交互轨迹。这些数据任何外部模型都拿不到,而且每过一天都在增加。这条护城河是 0 边际成本的。
2. 闭源模型厂商的「看不见的天花板」。 当场景足够垂直,通用模型的能力溢出越来越严重——参数规模、上下文长度、世界知识,对一个只想生成 CRUD 表单+鉴权+部署的小应用来说全是浪费。Base 1 的目标函数比 GPT-5.5 简单得多:在 vibe-coding 这一项上超过所有外部模型,其他全部不要。
3. 单位经济学。 Base44 ARR 1.5 亿美元,如果 50% 的 token 成本从 Claude/GPT 切到 Base 1(自托管),按外部 API 大约 3/15 美元/百万 token 的混合价、自托管 GPU 0.6 美元/百万 token 估算,光是这一项一年就能省下 2000–3000 万美元。这还不算延迟下降带来的转化率提升。
4. 验证了「小而专」的工程哲学。 与其卷一个 1T+ 的通用模型去追 GPT,不如在一个 50B 量级、把整个 1.5 亿 ARR 业务闭环的窄域任务上做到 95 分。这跟 Cognition 的 SWE-1.7(基于 Kimi K2.7 后训练、专攻 Devin 任务)是同一种思路——只不过 SWE-1.7 走开源后训练,Base 1 走全自研。
这对其他 vibe-coding 平台意味着什么
- Bolt / Lovable / v0:如果不在 6–12 个月内拿出自己的模型(或找到独家数据合作),单位经济会被 Base44 拉开 1–2 个量级。
- Replit Agent / Cursor Composer:Replit 已经在押 CodeSandbox + 自家 agent 框架,Cursor 走 Composer 自研路线;Base44 的动作会加速这两家把「自研」从 P0 项目提升到 P0+。
- 闭源 API 厂商:这是 Anthropic / OpenAI 第一个「看不顺眼但也挡不住」的客户流失形态——平台方不是不想用,是要把自己的利润留在自己手里。
我的判断
Base 1 不会是 7 月最强的 LLM,但它可能是 7 月最容易被低估的:一个 ARR 1.5 亿美元的垂直平台,正式宣告「我的 LLM 比你的 LLM 更懂我的用户」。这种「场景富→数据飞轮→自研模型→单位经济反超」的闭环,正是过去两年 SaaS 行业反复念叨却很少有公司真正跑通的剧本。Base44 跑通了。
下一个值得盯的信号:Base44 会不会在 3 个月内,把 Base 1 通过 API 卖给第三方 vibe-coding 工具(类似 Cognition 把 SWE-1.7 留在内部,但不排除 API)。如果走通,vibe-coding 这条赛道会出现第一个「既卖铲子又挖金子」的平台。