Transformer 在 2017 年为翻译而生——Google 提出它,是为了替换自家的机器翻译架构。九年后,由这篇论文作者参与创立的 Cohere,绕回了起点:发布翻译专用大模型 North Small Translate,权重开放在 Hugging Face。
发布了什么
North-Small-Translate-1.0 是一个稀疏 MoE 解码器:总参数 218B,每个 token 只激活 25B。架构上共 128 个专家,每 token 选 8 个,外加共享专家;注意力层以 3:1 比例交错滑动窗口注意力(窗口 4096,带 RoPE)与全局注意力(无位置编码),沿用 Command A 的设计;路由器对专家 logits 做 sigmoid 激活后在选中的 top-k 上归一化。
它覆盖 50 种语言(32 种高资源 + 18 种其他),上下文 16K 输入 / 16K 输出,纯文本进出。官方提供三档量化:BF16 需 4×B200 或 8×H100,FP8 需 2×B200 或 4×H100,4-bit NVFP4 版本 1×B200 或 2×H100 即可跑。许可证为 CC BY-NC 4.0——研究开放,商用走 RWS 的 Language Weaver 平台。
跑分:专科生对阵通才
在 Cohere 自己运行的 WMT26 全语言评测(以 GPT-5.6-Sol 为评审)上,North Small Translate 得分 83.60,领先 Qwen 3.5 397B A17B(81.56)、DeepL NextGen(81.37)、Gemma 4 31B(79.46)、GLM 5.2 FP8(76.50)与 Google 翻译(68.20);支持自查自纠的「Agentic」版本进一步到 84.36。
长文档是差距最大的地方:单次调用翻译两章书,它得 48.9 分,Google 翻译 21.3、Gemma 4 31B 19.4——超过通才模型的两倍。
效率账
同等硬件与并发下,它的输出吞吐达到每秒 112 token,Gemma 4 31B 为 81(高并发下 39 对 30),多出约 30-38%。商用配置平均每任务只耗 661 token、$0.000676;Cohere 给出的对照组 Gemini 3.1 Pro Preview(high)每任务 $0.038928,贵 5762%。
冷水先泼
以上数字全部出自 Cohere 自测。MarkTechPost 提醒,在独立 WMT26 结果出现前应视为厂商自报;基准聚合站 BenchLM 同样只作展示、不纳入加权排名。市场反应也偏冷清:HF 模型卡显示近一个月下载量约 40 次。
但信号是真的:继 Command A+、North Mini Code 之后,这是 Cohere 四个月内第三批开放权重发布,沿用同一套 218B/25B 骨架,这次打的是 DeepL 的主场——主权 AI 场景(本地化、政务、受监管行业)要求数据不出境,过去只能在闭源 API 与通用模型兼职之间二选一,现在多了一个在厂商自测榜单上压过 DeepL、且两块 H100 装得下的选项。
九年前 Transformer 是为了让机器翻译而设计的;后来通用化吞掉了一切专科。反攻,从一张装进两块 H100 的模型卡开始。
参考:Cohere 官方博客 · HF 模型卡(CohereLabs/North-Small-Translate-1.0) · MarkTechPost 报道