过去两年,"深度研究"类产品的通用形态是:AI 搜网页,整理成结构化报告。但真实科研工作往往在报告写完才真正开始——原始输入是几十篇论文、实验记录和各种专业格式文件,要清洗数据、写代码、跑分析,计划随中间结果不断调整。Apodex 8 月 24 日发布的 1.1 版模型正冲着这个缺口:把推理从报告里拿出来,放进真实任务的执行过程。

PIVOT-RL:在数十万条轨迹里找关键决策点

长轨迹任务的强化学习有个核心难题:终局结果只提供粗粒度监督——成功的轨迹里仍藏着低效的中间决策,失败的轨迹前半段也有真正有用的工作。Apodex 的解法叫 PIVOT-RL:对数十万条轨迹做事后分析,定位改变任务走向的关键决策点,保留有效前缀,构造带短纠正提示的局部继续任务;提示只在训练时提供方向引导,推理时不存在。整体采用 SFT 加 agentic RL 组合,让失败恢复和任务交付成为模型学到的行为。能力沿两条路径扩展:Environment Scaling(文件、搜索、代码等环境的数千万训练任务)与 Agentic Coordination Scaling(任务分解与多 Agent 协调),共用叫 AgentOS 的运行时基座。

异步 Agent Team 与 Statement Review

Deep Discover 模式下,模型动态组建异步 Agent Team——不是预写编排脚本,而是模型自己判断任务怎么分解、交给几个 Subagent,多个 Subagent 并行探索,中间结果持续回喂主任务。用户中途介入被当作任务的一部分:系统判断哪些中间结果仍有效,从当前状态继续而非推倒重来。交付前的 Statement Review 把生成与审查分开:某条数据是否真支持统计显著性、被引论文是否真说了报告转述的话,关键结论先过独立检查才到用户手里。

三个带数字的用例

法律场景的破产偏颇清偿案中,系统重建六笔付款的历史,得出 55 万美元净敞口,与参考答案一致,并给出 17.5 万到 35 万美元的和解区间与法律备忘录。金融场景的外汇对冲任务里,系统算出 760 万美元领式组合净成本和 1.1172 的盈亏平衡汇率,还发现 CFO 对会计处理的假设有误,按 ASC 815 重新推导了影响。科研场景最硬核:从 7M6J 蛋白质结构出发,用 Martini 3 粗粒化方法生成力场拓扑,搭出包含 69,652 个模拟位点的 GROMACS 模拟体系并完成能量最小化。

开源部分与 AI4AI

本地部署方面,35B 的 Apodex 1.1 mini 公开参数规模;配套 FrontierAgent 执行框架已在 GitHub 开源,命令行 TUI 支持 ReAct 与 Agent Team 两种模式,macOS 和 Linux 一条命令开箱即跑,不依赖 Docker。AI4AI 实验则让 Apodex 1.1 全程当老师——自动出题、过滤轨迹、评估迭代,无人工参与也不依赖其他强模型——用它训练 Qwen3.5-0.8B 在 200 道检索注释题上,10 轮迭代后总分从 51.0% 升到 56.0%。

所以呢

这家公司画的终局叫 Heavy-Duty Solver:接下越来越复杂的长周期工作,交付端到端可验证的结果,下一代 2.0 将从预训练阶段从头构建。当"会答题"和"能把一件事干完且经得起核查"分成两种能力,评测重心也会从单轮问答搬到长轨迹执行——Apodex 自建的两个基准方向就在这里(官方发布原文:https://www.apodex.com/blog/apodex-1.1-scaling-agentic-intelligence-for-complex-work)。