AllSpark Research 9 月 3 日公开的 Iris,从训练流程与推理时上下文管理两侧撕开"开源搜索 Agent 追不上闭源"这道口子。

模型与训练

Iris 一并放出两个 MoE:Iris-mini 是 35B 总参 / 3B 激活,Iris-pro 是 397B 总参 / 17B 激活,共用同一管线。SFT-RL climbing:监督微调冷启动 + 强化学习在真实搜索接口上做 on-policy 优化,反复交替;RL 阶段奖励裁判与 observation summarizer 都跑在训练集群内部,对超长 rollout 在请求级打断、从已提交的 prefix 处续跑。

数据工程

训练任务不是从问答语料挖,而是从网页超链结构反向构造:取种子页面、沿外链展开成实体图、写多跳问答链、把所有非答案实体改写成描述性引用让任何线索不能字符串匹配命中,最后做闭卷验证——这道题必须让 reference 模型闭卷答不出,但把支撑证据喂给它就能解。

这一步是质量门,把"答案能从问题里抄出来"的低质样本挡在外面。幸存问题变成轨迹,过滤后才进入 SFT。这种"图结构反向挖题 + reference rewrite + 闭卷失败验证"三段式,从正面堵掉"题目泄露答案"——搜索 Agent RL 的最大隐性成本是 reward hacking,Iris 把"题面不能再含答案"做成硬约束,把这条 hacking 路径堵掉一半。

基准数字

四基准统一用单 ReAct Agent、无子 Agent、无 test-time verification,固定工具集、上下文窗口与裁判模型。启用推理时 context management 后:Iris-mini 在 BrowseComp、BrowseComp-ZH、DeepSearchQA、HLE 上分别拿到 82.2、84.8、86.9、52.3;Iris-pro 拿到 88.6、85.1、92.9、56.4。

论文明确:在各自参数段位,两个模型是开源搜索 Agent 中总体最强的。BrowseComp-ZH 上 pro(85.1)只比 mini(84.8)高 0.3 分,其余三榜拉开 4 个点以上——大参数对深度证据检索的边际收益,比对中文检索更显著

论文同时对比"开启 / 关闭 context management"两组结果,同基准、同工具集、同裁判——把"context 管理"与"模型本身"两条曲线拆开,坐实"上下文管理在复杂 web 基准上比多数系统级差异更值钱"。

开放与启示

AllSpark 计划放出模型权重、数据构造与训练评测的完整 recipe、配套 GitHub 仓库 github.com/AllSpark-Research/Iris。有 35B / 400B 段算力的团队可照 SFT-RL climbing 步骤把自有基座复刻成同段位搜索 Agent——训练数据是怎么造的,比训练脚本怎么写更值得公开

context management 不是新词,但把它当成"和基座同台 PK"的变量,是论文另一个值得抄的方法——HLE 56.4 这种高难基准里,上下文管理带来的相对涨幅往往盖过换基座的涨幅。做 deep research 类产品的团队,启示很直接:别只盯着换基座,先把上下文管理做成独立模块、把工具调用做成稳定 API、把奖励做成低时延裁判

来源:AllSpark Research,arXiv 2609.04304(2026-09-03 提交),HF papers 当日榜首(43 upvotes)。https://arxiv.org/abs/2609.04304