9 月 2 日,开源权重池里出现了一个少数派:RWKV 项目把 RWKV7-G1j 13.3B 检查点以 Apache 2.0 许可上架 Hugging Face。说它少数,是因为当前开源生态几乎全员收敛在 Transformer 架构上,而 RWKV 坚持的是另一条技术路线——不用自注意力,用循环。

机制:固定状态取代不断增长的 KV cache

RWKV-7(代号 Goose)是 attention-free 的循环语言模型。与 Transformer 在不断增长的上下文窗口上做注意力不同,它按顺序处理 token,并维护一个固定大小的循环状态。带来的直接差异在成本曲线:推理时每个 token 的内存与计算开销大致恒定,不随序列长度上涨,长序列生成因此可能比同类注意力系统更便宜。训练侧也没有丢掉并行性——模型卡明确,训练仍然可并行化,循环解码时每生成一个 token 的工作量对序列长度而言是常数。

这个检查点的具体规格:FLA 版本参数量 13.269B,61 层,隐藏维度 4,096,注意力头 64×64,前馈层 16,384,词表为 RWKV World tokenizer 的 65,536 tokens,配置上下文长度 16,384 tokens,权重 BF16 精度。是 dense 设计,不是 MoE。词表覆盖多语言,而非仅英语。

发布形态:挤进你现有的工具链

这次发布的工程姿态相当务实:检查点以 flash-linear-attention(FLA)库的 RWKV7 布局提供,装好库、import fla 之后,直接用 Transformers 的 AutoModelForCausalLM 加载推理,不需要换掉整套技术栈。模型卡附带了本地验证记录——配置、tokenizer、chat template、BF16 权重、Transformers 模型加载逐项验证,2,016 个模型张量全部加载进 RWKV7ForCausalLM,无缺失、无意外、无形状不匹配的 key。源检查点来自 BlinkDL/rwkv7-g1,G1j 是这次发布的修订标识。截至目前页面列出 31 个社区衍生微调,上月下载量 122——数字不大,但说明有人在真实地用,而不是又一个发完就沉的仓库。

值得注意的诚实

模型卡有两处自我交代,在当前的发布文档里并不多见。其一,它明确说这是 base 语言模型,不是经过安全对齐的指令微调助手:附带的 chat template 提供了会话格式,但模型可能不会稳定遵循指令。其二,验证环境的说明写得很清楚:本地是 CPU-only 环境,CUDA/Triton 生成没有执行过,运行时行为依赖 GPU、CUDA、PyTorch、Triton 与 FLA 的具体版本,报告 benchmark 结果前应先对照官方 RWKV 实现交叉核对。没验证什么、哪些结论需要用户自己复核,发布方直接写在文档里——这比营销腔的 model card 信息量大得多,也是替代架构项目建立信任的正确方式。

所以呢

开源生态的架构收敛是事实:模型尺寸、MoE 配比、注意力变体,大家卷的都是同一套 Transformer 底盘上的参数。RWKV7-G1j 的价值在于提供了一个持续维护的对照组——它维护固定大小的循环状态,而不是随前序序列增长的 attention KV cache,这条对照线本身就是它存在的理由。对做长序列、成本敏感推理的团队,这类检查点值得纳入对照实验;对整个生态,替代路线每存活一个版本,「推理成本曲线长什么样」这个问题就多一个答案。

模型详情与权重见 Hugging Face 仓库:https://huggingface.co/fla-hub/RWKV7-G1j-13.3B-20260831