8 月 4 日 Pokee AI 上线 Pokee-Isaac 28B,一个 28B 参数、纯文本的 agent 基础模型,主打一件事:把 agent 跑在客户的边界里,而不是云 API 里。它的上下文窗口拉到 10M tokens——不是只声明「支持」,是在 RULER 长上下文基准每个测量长度下都能跑出可用的分数。

官方技术报告里最刺眼的一张表是 RULER:256K 到 10M,Isaac 全部测出分数,从 96.9 到 93.3。同表里 GPT-5.6 Luna(Azure)到 512K 还撑得住,1M 直接 context-overflow;Gemini 3.5 Flash Lite(Vertex AI)在 1M 拿到 29.4,1M 之后全部归零;Claude Haiku 4.5、Qwen 3.5 122B 在 256K 就已经 0.0;只有 Nemotron 3 Super 自报 91.75 到 1M——是 vendor 自测,不是 Pokee 同环境复测。换句话说,「10M 能用」目前只此一家。

MRCR v2:多针检索差距拉到 0.3

MRCR v2 是更狠的测试:在长上下文里埋 8 根「针」,要求模型检索并消歧指定的某一根。Isaac 在 256K/512K/1M 三个长度上分别是 0.607/0.743/0.500,Luna 是 0.208/0.173/0.050,Gemini 0.474/0.473/0.205,Haiku/Nemotron/Qwen 全部 0.000。1M 处 Isaac 对第二名的领先幅度从 256K 的 +0.133 涨到 +0.295,越长的上下文,Isaac 的优势越大。这说明 Isaac 不是「能塞 10M 字符串」,是真的能在 10M 里检索信息。

Agent 能力:四块基准,两个第一

BFCL v4(AST 评级的 function calling)Isaac 70.94,Luna 70.61,Haiku 67.52——基本是平手,Isaac 0.33 分的领先只是 parity,但意义在「这是能部署在客户边界里那一档」。

τ³-bench(多轮客服任务)Isaac 0.662 四域平均排第一,第二名 Gemini 0.631,Luna 0.527。banking 子项整个面板都跌——全场最好 0.203,Isaac 0.186,几乎算这一档。

Terminal-Bench 2.1(真实 shell)Isaac 65.1%(56/86),Luna 69.8%(60/86)。这是 Luna 唯一赢的一档,差距只有 4 个任务。

MCP-Atlas(36 个 live MCP 服务,不给名字让模型自己发现)Isaac 74.59% 排第三,落后 Luna 3.3 个百分点,但只用了 9.10 turns,而 Luna 用了 14.99。覆盖率差一截,效率高一截。

安全:同环境对比,最低 ASR

DTAP red-teaming 测的是 agent 在模拟环境里被注入攻击时的成功率。Isaac 在 Direct ASR、Indirect ASR、Combined ASR 三项全部最低:36.0 / 35.2 / 35.6,Benign Success Rate 82.5。Luna 是 54.4 / 46.1 / 50.1,Gemini 高到 84.1 / 49.5 / 66.3。报告同时说明两条限制:indirect 数据是在 guards-inactive 下测的(因为实验 harness 匹配原生工具名,DTAP 攻击走 MCP);模型只在 1.5% 的恶意任务上明确拒绝——大部分「安全」是「碰巧没动手」而不是「主动挡下来」。这一点 Pokee 自己写得很坦白。

服务画像:一卡 B200 撑 137k prefill

单卡 NVIDIA B200 上测出来的:RULER 工作负载下,1M 上下文 TTFT 23.6s、Prefill 42,400 tok/s、Decode 335 tok/s;10M 上下文 TTFT 涨到 72.9s,Prefill 反而爬到 137,200 tok/s,Decode 稳定在 335——prefill 吃长度,decode 不吃。RTX 4090/5090 工作站可跑,Intel Arc Pro B70 上 prefill 是 stock llama.cpp 的 3.6–5 倍,Qualcomm Snapdragon X2 Elite 与 Intel Panther Lake NPU 上也能跑端侧。

定价 $0.15/$1.00(per million in/out,标记 provisional),给 10M 上下文。Luna 在 1M 之后不再商用定价,Haiku/Nemotron/Qwen 在 262K 就不能买——「云 API 卖不到的长度」才是 Pokee 的真正锚点。

评论:agent 部署范式开始分叉

过去两年的 agent 故事是「更强、更长、更便宜」的云端竞速。Pokee-Isaac 走的是另一条路:用相对克制的 28B 参数换 10M 上下文和 agentic benchmark 平价,把「数据不出边界」做成产品特性,而不是合规补丁。

这件事在监管严苛的行业(医疗、金融、国防、法律、e-discovery)有真实需求——这些场景不是「更喜欢隐私」,是「数据必须留在本地」。当一个 28B 模型能在 RULER 10M 上 93.3%、BFCL v4 平 Luna、agentic benchmark 第一档、ASR 同环境对比最低,意味着客户不再需要为「本地部署」在能力上做大幅妥协——这是一个范式分叉的起点。

来源:Pokee-Isaac 28B 模型页 | MarkTechPost 报道