汤森路透把 Thomson-1.0 家族的开源权重成员挂上了 HuggingFace:Thomson-1.0-Small,35B 总参数、3B 激活的 MoE,原生 262,144 上下文,底座是 Qwen3.6-35B-A3B。技术报告《Thomson: Continual Learning of Frontier Models for SovereignAI》8 月 27 日提交 arXiv(编号 2608.27147),权重以 BF16 格式提供,兼容 Transformers、vLLM、SGLang 等推理栈。
算力账:前沿模型到底要花多少钱
论文的核心论点很直接:前沿性能不是少数巨额融资玩家的专利。整个流水线消耗约 1.63×10²³ FLOP,折合 35,207 个 B200 GPU 小时;中期训练语料从超过 19T tokens 的池子里筛出 200B tokens,由专有文档、这些文档的同义改写、通用能力回放数据三部分大致均分。合作方包括帝国理工学院(共同完成价值对齐)、DatologyAI(数据策展)与 Lambda。
三段式流水线
第一阶段做价值对齐,用 Constitutional DPO 把模型对齐到公开可修改的 Public AI Constitution,而不是某家公司的私有价值观;第二阶段持续预训练,吸收汤森路透数十年积累的新闻、合同、监管文件、判例、法规与实务指引,同时用模型合并保护通用能力;第三阶段后训练混合 DPO 与强化学习,偏好数据直接派生自专家撰写的内容,还包括基于 IRAC 案例分析框架的本体驱动偏好数据,以及 Deep Research 代理式 harness 的奖励设计——后者的奖励结构专门激励忠实的工具使用和准确的引用习惯。
跑分真相:赢在哪、输在哪
总体均分 74.6,高于同底座 Qwen3.6-35B-A3B 和中间检查点 Snowdon-1.1-Small 的 71.7,也压过 Gemma 4-31B(71.2)和 Haiku 4.5(68.2)。亮点集中在专业场景:Harvey 法律 Agent 基准 73.4,高于底座的 69.5,Gemma 4-31B 在该项甚至没过 35 分;税务 Deep Research 78.6;通用 Agent 85.8;政治中立性 98.5。短板同样明显:编码 37.4 反而低于底座的 39.8;MBE 律师资格考试 83.4 输给 Gemma 的 88.8;多语言 71.9 距 Haiku 的 85.8 差距不小。更值得注意的是论文所说的「π 形」增益——非目标能力不降反升:AIME 2026 从底座的 86.7 提到 90.0,MMLU-Pro、GPQA-Diamond 均小幅上涨,基本消除了窄域适配常见的灾难性遗忘。
所以呢
这篇论文真正想论证的是 SovereignAI:一家内容公司拿着开源底座、3.5 万个 B200 GPU 小时的预算和自家专有语料,就能在法律、税务这类高价值垂域做出有竞争力的模型,并把模型权重、工具链、价值观对齐整条栈握在自己手里。对行业观察者而言,Qwen 开放权重生态正在成为全球机构做「主权 AI」的事实底座——这次是伦敦的出版商,下一次可能是银行或律所。技术报告:arxiv.org/abs/2608.27147;权重:huggingface.co/thomsonreuters/Thomson-1.0-Small。