网络安全这条赛道,LLM 评估长期分两极:一边是 CTF 式知识题,测的是「知道不知道」;另一边是端到端 Agent 跑通率,测的是「整条链路能不能走完」。真正卡在中间、决定一名安全工程师能不能用上 AI 的关键能力 —— 把自然语言请求翻译成一行能在终端里执行正确的 nmap、sqlmap、burp 命令 —— 反而没人直接测过。原因不复杂:命令行对参数顺序、flag 别名、键值绑定极其敏感,微小的拼写错误就会让整条命令失效,而打分又必须脱离模型自描述、与真实工具行为对齐。
Khalifa University 与西澳大学团队把这个缺口补上。10 月 1 日挂到 arXiv 的 2610.02206(NeurIPS 2026 Evaluations and Datasets Track)带来 KaliBench:一个面向 Kali Linux 的细粒度网络安全工具调用基准,数据来自官方工具手册,经 LLM 校验 + 沙盒终端执行 + 人工复核 + 语义去重四道工序,最终留下 8,504 条查询-命令对(3,504 训练 / 5,000 测试),覆盖 1,642 个工具、23 个能力维度与 5 个安全阶段(侦察与初始访问、漏洞分析、利用与投递、后期渗透、防御分析与报告)。
难的不是选哪个工具,而是写对参数
KaliBench 把评估拆成四块:工具选择、可选参数 F1(按 alias-aware 匹配)、位置参数 F1(多重集匹配),以及严格意义上的「命令精确正确」(允许文档化的别名与可选 flag 重排,但位置参数顺序保持不变)。在无任何工具提示的「unrestricted」设定下,24 个开源权重模型跑出的最强成绩是 GLM-5.2(753B)的 41.3%,DeepSeek-V3.2(685B 总参 / 37B 激活 MoE)33.0%,Qwen3-Coder-Next(80B / 3B MoE)26.2%,中位区间大多在 20%-30% 之间 —— 没有任何一个模型超过 42% 的精确率。给 20 个候选工具的「restricted」设定把均值抬到 28.3%,而给到目标工具及文档的「hinted」设定直接抬到 73.1%,差距接近 50 个点。
这条曲线说明一件事:工具选择并不是瓶颈。RedSage-K(论文中作者把自训模型叫 Kali-SFT+GRPO,这里沿用项目页的 RedSage-K 命名)在工具选择这一项拿到了 77.9% 的准确率,与 685B 的 DeepSeek-V3.2(75.8%)同档;真正的差距在可选参数 F1 与位置参数 F1 上 —— 8B 模型在可选参数 alias 还原、键值绑定、参数顺序保持这些细节上仍明显落后。这意味着对工程团队来说,KaliBench 给出的不是「网络安全能不能交给 LLM」的二元答案,而是「工具调用接口层的具体哪一档具体在哪一格」的可量化诊断。
训练信号不用现成模型,而是 ground-truth 命令
KaliBench 的另一层价值在于「runtime-free verifiable rewards」。数据集构建阶段已对每条样本做过命令正确性核验,在训练阶段,确定性打分可以同时给工具选择、可选参数、位置参数、命令级精确率、输出格式各维度的奖励,无需在训练循环中执行模型生成的命令。这与 RLVR(Reinforcement Learning with Verifiable Rewards)近一年成为热门训练范式的趋势是契合的,但 KaliBench 的设计把它推到了「网络安全工具调用」这个尚未被 RLVR 渗透的细分领域。
作者团队用 RedSage-Ins 8B 作为基座,先做监督微调(SFT),再做 GRPO 强化学习,得到 RedSage-K 的三个变体(纯 SFT / 纯 GRPO / SFT+GRPO)。在三个评估设定的平均总分上,8B 基线 71.7 → 纯 SFT 77.4 → SFT+GRPO 79.2,而 685B / 37B 激活的 DeepSeek-V3.2 是 80.2。1.0 分的差距,在「8B vs 685B / 18× 参数量」的悬殊对照下,几乎是平起平坐。开源权重的 RedSage-K(SFT-GRPO)模型权重同步发在 Hugging Face(RISys-Lab/RedSage-K-SFT-GRPO),训练与评估代码在 GitHub(RISys-Lab/KaliBench),数据本身也在 HF 集合中公开。
商业模型把天花板抬到哪里
论文 Table 2 给出闭源系统的对照:GPT-5.6-Sol 在 5,000 条评测里答出 4,988 条,精确率 61.83%(覆盖全部样本的精确率 61.68%);Codex CLI(GPT-5.5, xhigh 推理强度)答 4,633 条,精确率 55.77%(全样本 51.68%);Claude Opus 5 答 3,675 条,精确率 59.89%(全样本 44.02%)。注意这里的全样本精确率把「拒绝回答 / 未生成」也算错 —— 也就是说在网络安全这种可能触发安全护栏的领域,模型敢不敢答、答不答得动,本身就是分数的一部分。这一组数字与开源权重那段一起读,KaliBench 给出的图景是:闭源模型路线拿到 60%+ 的精确率,开源路线卡在 30-40%,但经过针对性训练后,8B 开源模型能把距离压到 1.0 个百分点。
对做网络安全工具的工程团队,KaliBench 把「自动驾驶工具推理」这件事从一句口号变成了可量化、可训练、可对照的实验台 —— 8B 模型跑 79.2 分,DeepSeek-V3.2 跑 80.2 分,差 1 个点这件事本身,比「LLM 不能用」或「LLM 可以用」更接近真实工程现场。
参考:arXiv:2610.02206(risys-lab.github.io/KaliBench);GitHub 仓库 RISys-Lab/KaliBench;HF 集合 RISys-Lab/kalibench-datasets-and-models;GPT-5.6-Sol 与 Codex CLI、Claude Opus 5 数字见论文 Table 2