Agnes AI 在 HuggingFace 上线了 33B 参数的 Agnes-3.0-Flash Preview,Apache 2.0 许可,权重可直接下载。这不是又一个"Dense 模型换个名字"的发布——它的注意力结构本身就是这篇模型卡最值得读的部分。

KV 缓存只长在 18 层

Agnes-3.0-Flash Preview 是一个混合注意力解码器:每四层里,三层跑门控 delta 规则(gated delta rule)递归层,第四层才跑标准全局注意力,3:1 交替。全模型 72 层,54 层是递归层,18 层是全局注意力层。

这个结构直接改变了推理时的内存曲线:delta 规则层的递归状态每层固定、与序列长度无关,只有那 18 层注意力层的 KV 缓存会随上下文增长——长上下文场景下用计算换内存的经典路线。模型卡规格全公开:递归状态 fp32 存储、hidden size 5120、词表 248,320、3 轴旋转位置编码。

上下文窗口 262,144 token。硬件门槛:一张 H200 141GB 或 H100 80GB,bf16 权重约 66GB,建议主机内存 128GB 以上。一台单卡工作站就能跑满 262k 上下文的多模态模型,不需要集群。

跑分:厂商自报口径

模型卡给出对照表,但明确标注数字"来自不同来源、不同 harness、不同模型快照,不构成受控对比"。Agnes-3.0-Flash Preview 参考值:IFBench 74.20、GPQA Diamond 85.05、SciCode 38.08。对照列里,Qwen3.8-27B 的 GPQA 是 90.5、MiniMax M3 是 92.9——GPQA 上明显落后头部;IFBench 74.20 则高于 Qwen3.6-35B-A3B 的 64.4。

换句话说,它的定位不是刷榜旗舰,而是"单卡可跑的长上下文多模态基座":支持文本、图像、视频理解,工具调用,chat template 带 high/medium/low 三档推理力度。加载需要 trust_remote_code=True,transformers 5.12 起支持。

一个罕见的诚实标注

模型卡专门设了"Model version clarification"一节:这批开源权重是 Preview checkpoint(33B、262k 上下文),而 Artificial Analysis 榜单上的 Agnes 3.0 Flash 是另一个 production/API checkpoint,1M token 上下文,"其 benchmark 结果不应归到此处发布的 Preview 权重上"。仓库最初就叫 Agnes-3.0-Flash,后来才显式加上 Preview 后缀澄清两者区别。

开源版与 API 版同名不同能力,过去一年在这个行业里通常是用户自己踩坑才发现的;把区别写进模型卡第一节,并主动改仓库名,这个动作本身值得记一笔。

所以呢

截至发稿,HF 上已有 7 个社区量化版本(llama.cpp/Ollama 等生态),上月下载量 474——不算热,但"架构混编 + Apache 2.0 + 单卡门槛"这个组合,对做本地部署和长上下文应用的团队是个低成本试验对象。delta 规则与注意力 3:1 混编能否在更多尺度上复现,值得持续观察。

引用:模型卡 https://huggingface.co/Agnes-AI/Agnes-3.0-Flash ;The Open Weights 报道 https://www.theopenweights.com/news/agnes-3-0-flash-z86d