从"用别人的模型"到"训自己的模型"
一家把法律 AI 生意做到 110 亿美元规模的美国独角兽,要出自己的第一个模型了。而它的训练底座,既不是 GPT,也不是 Claude,而是中国公司月之暗面(Moonshot AI)开源的 Kimi K3。
据 Business Insider 独家报道,法律 AI 公司 Harvey 在周二发布了其首个自研专有模型 Harvey Tenet,定位是承担以往需要律师花数小时甚至数天才能完成的工作,并且成本低于它目前依赖的第三方模型。
Harvey 是谁,为什么突然要自研
Harvey 的原有生意模式,是典型的"模型层之上的应用层":在 OpenAI、Anthropic 等公司的通用模型之上,搭一套面向律所和企业法务的软件。Business Insider 称其已经做成了一门 110 亿美元规模的法律软件生意。
问题在于,每次律师通过 Harvey 调用一次外部模型,Harvey 都要向模型供应商付费,用量越大这笔"过路费"越重。更微妙的是,Anthropic 正在用文档审查、起草类插件直接争取律师客户,OpenAI 则雇了 Ironclad 创始人 Jason Boehmig 领军法律业务——供应商正在变成竞争对手。
自研模型的动机因此非常直白:把更多任务路由到自己的引擎上,在不向客户涨价的前提下改善毛利。联合创始人 Gabe Pereyra(前 Google DeepMind 研究员)同时强调质量动因:Harvey 本来就在按任务把工作分发给最擅长的模型,Tenet 是这个路由组合里的新选项。
训练数据是"雇律师造出来的"
要训一个法律模型,先得有能教模型"像律师一样思考"的数据。BI 披露的做法是:Harvey 雇佣了在职和签约律师(通过 Mercor、Snorkel 这类公司签约),让他们虚构模拟纠纷和案卷,再给模型在这些材料上的推理表现打分,用这套流程造出的数据去训练模型。
而训练的底座,BI 的表述是:Harvey 用这些材料训练了 Kimi K3 的一个版本——"一个来自中国初创公司月之暗面的低成本开源模型,自 7 月发布以来,该模型凭借能力和价格在科技界掀起了热潮"。
MoonshotAI 的 GitHub 仓库显示,Kimi K3 是一个 2.8 万亿参数的开放权重模型,基于 Kimi Delta Attention(KDA)与 Attention Residuals 架构,原生多模态,支持 100 万 token 上下文窗口。
公开版 Kimi K3 本来就是法律基准第一
Harvey 选 Kimi K3 并不突然。在 Artificial Analysis 独立运行的 Harvey LAB-AA 法律基准上——120 个私有任务、覆盖 24 个法律执业领域,agent 需要在沙盒里通读案卷并产出备忘录、披露清单、质证摘要等真实法律交付物——公开版 Kimi K3 (max) 以 94.6% 的准则通过率(criteria pass rate)排名第一,领先 Claude Fable 5(93.6%)和 Muse Spark 1.1(93.1%)。
换句话说,在 Harvey 自己参与出的考卷上,最强考生之一本来就已经是 Kimi K3。
但有两个保留意见:其一,Tenet 本身的基准分数尚未发布,Harvey 只说"很快会放出对比研究";其二,BI 自己也提醒,模型厂商的自测基准天然要打折扣——厂商先用测试找出短板再针对性训练,时间长了有点像"帮着写完答案再考试"。
不止一个模型,是一整套 Harvey II
Tenet 只是被包装进"Harvey II"的一部分。首席产品官 Anique Drumright 介绍,Harvey 还上线了新的 Memory 功能,让用户保存自己的工作偏好,agent 在跨任务执行时可以携带这些指令。
Pereyra 的终局设想更激进:让 Tenet 成为律所训练自有模型的起点底座——每家律所在 Tenet 之上,用自己律师数十年的工作方法继续训练出专属版本。BI 的评论是,这会让 Harvey 越来越像"四大"那样的专业服务公司而非软件供应商;而一家长期被讥讽为"ChatGPT 套壳"的公司,如果真做成,套壳反而可能变成整个技术栈里最值钱的那一层。
值得注意的时间细节:Tenet 目前还没有上线到 Harvey 产品里,公司也拒绝透露具体时间,Pereyra同样拒绝点名哪些律所可能在内测。
所以呢
对中国开源模型来说,这件事的信号比任何榜单都硬:下载量只能说明模型"被拿走",而被一家美国独角兽选为自研模型的训练地基,才说明它"被依赖"。当垂直玩家连自研模型的地基都敢交给中国开源模型时,开源模型的全球化叙事,才算真正从 Hugging Face 的榜单,走进了别人的生产管线和成本结构。