2026 年 9 月 27 日,EverMind AI 把一份题为 Raven: The Harness of Harnesses for Composable Agentic Intelligence 的论文放上 arXiv,三天后冲上 Hugging Face 论文日榜第一,拿下 284 个赞,配套 GitHub 仓库收获近 4.9k 星、1744 次提交。在 agent 框架多到数不过来的今天,这个热度说明它踩中了行业的某个真痛点。
从「更强框架」到「框架的框架」
过去两年,agent 圈的做法是针对一个领域手工打磨一套 harness:写好规划流程、配好工具、调好 prompt。论文指出这条路有两天花板——框架复杂度越来越高,人工设计难以扩展;框架和领域绑定太深,单一框架没有通用性。Raven 的思路是换问题:不再问「怎么给一个领域造更强的框架」,而是问「怎么自动构造专用框架、用经验持续改进、再跨领域编排它们」。它把每个可执行的「模型-框架」配对当作一个可组合的智能单元,让 Host Agent 负责拆解目标、匹配子任务给专家智能体、协调执行依赖、汇总结果,记忆系统 EverOS 和 Skill Forge 则把经验沉淀成可复用的技能。论文还给出了组合扩展可靠任务覆盖的充分条件——这类工作通常只出现在系统论文里,罕见地配了理论。
四个内置专家和一个会改自己的工具
Raven 内置四员大将:Raven-Research 做自主深度研究,Raven-Code 做智能体软件工程,Raven-Design 做视觉设计,Raven-Oncall 做无人值守的实验与监控自动化。官方 README 称四者在各自领域达到 SOTA 水平,并列出 SWE-bench Pro、PresentBench、DataAgentBench 等一排 benchmark 图。更有意思的是 Raven Evolver:一个独立工具把 Raven 当库调用,诊断失败、测试候选改进、在可复现评估中保留跑赢基线的变更——等于给「框架自身进化」修了一条正规流程。README 还展示了一个 RSI(递归自我改进)案例:在 nanochat 预训练实验里,Raven 独立跑完 7 轮共 172 次训练零崩溃,在同样 20 分钟单卡预算内把 val_bpb 降了 5.8%。另一个案例里它自主工作约 4 天、42 轮规划-开发-验证,交付了一款可玩的 Godot 4 射击游戏,连海报、演示文稿和网站都是它做的。可信度 caveat 也要说清:仓库自述 pre-alpha,接口可能快速变化,SOTA 声明目前主要是官方自报,等第三方复现再下重注。
所以呢
Agent 竞争的叙事正在从「谁的模型强」转向「谁的 harness 会进化」。Raven 的实验至少证明了一件事:让 AI 改进 AI 的流程本身,已经被开源社区跑通了闭环。下一次你评估 agent 框架时,除了看跑分,不妨多问一句——它的 harness,会自己变好吗?