安全AI的“算盘账”:花同样的钱,进攻型和防守型AI谁更划算?

这项由Frontier Security研究团队完成的评测研究于2026年7月以预印本形式发布在arXiv平台,论文编号为arXiv:2507.15263v2,研究方向为网络安全领域的AI智能体评估。对于任何关心AI技术如何真正落地到安全领域、而非停留在"看起来很厉害"的表面数字的人来说,这项研究都值得认真了解。

当我们雇一名保镖,我们在意的从来不只是他打架有多猛,还要问:他一天收多少钱?他能同时盯几个地方?他打架时会不会误伤自己人?同样的道理,当网络安全行业开始讨论"用AI来做安全"这件事时,光问"它能破解多少道难题"是远远不够的。这篇研究的核心贡献,就是把这个问题推进了一大步——它不问"AI能做到什么",而是问"花同样的钱,AI能做到什么"。

一、为什么"光看成绩单"是个坑

在网络安全的世界里,有两种完全不同的工作。一种叫"红队",也就是扮演黑客角色去攻击目标,寻找漏洞、写出利用代码、想方设法突破防线,就像是在沙盘上模拟入侵演练;另一种叫"蓝队",也就是防守方,坐在安全运营中心(SOC)里盯着一屏幕的日志,分析告警,判断到底哪条数据是真的有人在入侵,哪条只是系统误报。

现有的AI评测方法,基本上只关心前者——让AI去解一道道"夺旗题"(CTF,Capture the Flag),看它能解几道。解题的时候,AI可以使用几乎无限的计算预算,反复尝试,直到找到答案为止。这种测法没有问题,但只看这个数字就像是只看一个厨师在"自助吃到饱"状态下能做出多少菜,却不管他一个晚上的食材成本是多少。真实餐厅里,厨师要在有限的食材预算内,做出让客人满意的菜。

Frontier Security的研究团队提出,评测AI安全智能体必须引入"成本"这个维度。每一次让AI"想一想",都要消耗算力,都要花钱。每一次让AI去查询日志、搜索互联网、核实一个IP地址,也都要花钱。一个在"无限预算"下能解90%难题的AI,和一个在"只给两块钱"的限制下能解85%难题的AI,哪个在实际工作中更有价值?答案显然不简单。

二、两块战场,两套评测题

研究团队选择了两个非常具体的测试场景,分别代表进攻和防守两种完全不同的工作模式。

进攻侧使用的是一套叫做Cybench的测试题库,里面有39道来自真实黑客竞赛的挑战题,题目类型覆盖密码破解、网页漏洞利用、逆向工程、数字取证等各种手艺活。AI要做的事情,是像一个真正的黑客那样,在一个沙盒环境里用命令行工具折腾,最终找到一个隐藏的"旗帜字符串"(比如HTB{...}这样的格式),提交正确答案才算得分。每道题最多可以提交3次,评测用的是三次独立运行的平均正确率。

防守侧使用的是Splunk公司提供的一套叫做"Boss of the SOC"第一版(BOTS v1)的数据集。这是一套模拟真实企业遭受网络攻击的日志数据,包含了网站被篡改事件和勒索软件攻击两个案例,共31道有评分的调查问题,总分10300分。AI要像一名安全分析师那样,在真实的Splunk平台上写搜索查询语句,翻阅日志,必要时查询外部信息(比如某个IP地址的注册历史),然后给出答案。答错了会触发"提示"机制,每条提示都扣分,答对才能得分。

两个测试场景的关键区别在于:Cybench几乎所有花费都是AI"想问题"的计算成本;而BOTS v1除了计算成本之外,还有真实的外部工具查询成本——比如查域名历史记录这个API,一次要收一点几美元,AI要懂得"值不值得查"。

三、同一把尺子量两种活

研究团队使用了一个统一的实验框架,让不同的AI模型在相同条件下完成这两类任务,然后以"花多少钱才能做到什么程度"作为共同的衡量轴。

参与测试的模型包括:OpenAI的GPT-5.5和GPT-5.6系列(GPT-5.6又细分为Luna、Terra、Sol三个版本,其中GPT-5.6系列和Claude Fable 5使用了最高推理强度设置);Anthropic的Claude Opus 4.8和Claude Fable 5;以及DeepSeek的v4 Flash和v4 Pro两款开源模型。

每个模型每道题都有一个"预算上限"——一旦这道题的花费超过上限,就直接判定失败。研究团队把这个上限设在每道题2.10美元(部分模型用了不同的上限做对比)。这就好比给每个选手发同样数额的"代金券",规定只能在这个额度内完成任务,超支就出局。

更有趣的是,研究团队还做了一种叫做"回溯性预算封顶"的分析:把每个模型完整跑完的记录拿来,在事后假设它只有0.80美元的预算,看看在这个更严格的限制下,成功率会下降多少。这样的对比能精确告诉我们,"多给一点预算"到底能买来多少额外的成功率。

四、进攻型AI:钱花得越多,破解得越多

在Cybench进攻测试上,结果相当直观——整体而言,预算越多,解题率越高,这和大家的直觉吻合。

GPT-5.5表现最强,在2.10美元的预算限制下解出了94.1%的题目,平均每解出一道题只花1.16美元,是所有模型里最省钱的之一。DeepSeek v4 Flash紧随其后,解出了86.4%,平均花费1.45美元每题。值得一提的是,DeepSeek v4 Flash这个数字格外说明问题:把它的预算从0.80美元放宽到2.10美元,成功率从76.1%跳升到了86.4%,提升了10个百分点——对于一个开源模型来说,这意味着更多计算预算能带来实实在在的收益。

Claude Opus 4.8在完整预算下达到76.2%,但在回溯性分析中,当预算从0.80美元放宽到完整的2.10美元时,成功率提升了整整18.8个百分点,说明这个模型在有充足预算时还有很大的发挥空间。

不过,这张成绩单上还有两个扎眼的异常数据。Claude Fable 5这个模型,在117道题(39道题乘以3次运行)里,每一次都在没有调用任何工具的情况下直接拒绝作答——成功率0%,花的钱也几乎全部打了水漂。这不是因为它"不会",而是它的安全过滤系统认为这类黑客题属于有害内容,直接拒绝参与。GPT-5.6 Sol的情况类似,90.6%的运行都被拒绝了,最终只有9.4%的题目得以完成。

这揭示了一个现实中不得不面对的问题:对于进攻型安全任务,模型的安全防护机制本身就会成为使用障碍。Fable 5和Sol这类模型有更严格的内容过滤,导致它们在合法的安全研究场景中根本无法使用。相比之下,GPT-5.6 Terra的拒绝率较低(39/117),实际完成了65.8%的题目,DeepSeek系列没有任何一次拒绝。

从工具调用量上看,DeepSeek v4 Flash的风格与众不同:它平均每道题调用了144.7次工具,是所有模型里调用最多的,最长的甚至跑了超过800次——通过大量尝试来弥补每次尝试质量的不足,就像一个不太聪明但非常勤奋的学生,做不来难题就反复磨,最终也能磨出答案。

五、防守型AI:砸更多钱,不一定守得更好

BOTS v1的防守测试结果,与进攻测试形成了一个鲜明的反差,这也是这篇研究最核心的发现之一。

Claude Opus 4.8在防守测试里得了9666.7分(满分10300分),折合93.9%的得分率,是所有模型里最高的。更重要的是,它做到这一点时,总共只调用了603次工具(扣除最终提交答案的操作),平均每1000分的花费只有2.98美元,是所有模型里最经济的。

对比一下DeepSeek v4 Flash:它在2.10美元预算下调用了4450次工具,打出73.0%的得分;把预算翻倍到4.20美元,工具调用次数涨到了4938次,得分只涨到73.9%。多花一倍的钱,多做了几乎同样多的额外操作,换来的提升不到1个百分点。这就像一个侦探,已经把案件现场翻了一遍又一遍,却还是看不出关键线索在哪里,于是继续翻第三遍第四遍,结果自然是徒劳。

GPT-5.6的三个版本(Luna、Terra、Sol)在防守测试上表现颇令人意外——它们分别获得了83.7%、92.1%、91.4%的得分,其中Terra和Sol甚至非常接近Claude Opus 4.8。不过要注意,这三个版本在进攻测试里要么被过滤器挡住、要么拒绝率极高,但在防守任务上却几乎零拒绝——说明Anthropic和OpenAI的内容过滤系统会区分"攻击性"任务和"调查性"任务,对蓝队工作的限制要宽松得多。

Claude Fable 5在防守测试里得到88.4%,是工具调用最少的模型之一,只用了309次——虽然它中间有5次出现了拒绝响应,但后续重试成功弥补回来了,最终得分不受影响。

从花费结构上看,防守测试里的成本比进攻测试复杂得多。DeepSeek v4 Pro在BOTS测试里花了71.82美元,是所有模型里最贵的,得分却只有77.8%;GPT-5.5高推理强度版花了64.57美元,得分81.4%;而Claude Opus 4.8只花了28.80美元,得分93.9%。一句话:贵的不一定好,便宜的不一定差,关键在于模型怎么用工具。

六、工具纪律,而非工具数量

研究团队专门分析了工具调用量与成绩的关系,这个分析结果非常有说服力。

在进攻测试里,工具调用量确实和成绩有正相关——调用越多,解题越多,DeepSeek v4 Flash那条"最高调用930次"的曲线一直在稳步攀升,说明在CTF解题这种任务上,"多试几次"确实有用。

但在防守测试里,这个关系完全反转了。Claude Opus 4.8以最少的工具调用次数取得了最高的分数,而DeepSeek v4 Flash以最多的工具调用次数却只得到了最低的分数。工具调用量和防守得分之间,呈现出近乎负相关的关系。

这个发现背后的逻辑其实很直观:在安全运营中心里,判断哪条日志重要、什么时候需要查外部数据库、什么时候已经有足够信息可以得出结论——这种"判断力"才是核心技能,而不是无脑地把所有工具都调一遍。一个技术精湛的侦探,能在翻过三次档案后就锁定嫌疑人;一个经验不足的侦探,可能把整个档案室翻个底朝天也找不到头绪。在防守型安全任务里,多干活不等于干对活。

七、一个必须正视的数据污染问题

研究团队在文章里相当诚实地指出了一个潜在的严重问题:BOTS v1这套测试数据是公开的,发布于2017年,已经在网络上存在将近十年了。这意味着,这些AI模型的训练数据里很可能已经包含了这些题目的答案——就像考试题目提前泄露给了学生。

为了检验这一点,研究团队做了一个简单但很说明问题的对比测试:把所有工具都拿走,只给模型看问题本身,让它凭"背景知识"直接回答,看看不用查日志能答对多少。

结果令人咋舌。GPT-5.6 Sol在没有任何工具的情况下,仅凭问题文本就能答对50.5%的题目;Claude Opus 4.8在相同条件下答对了50.0%;GPT-5.5答对了54.9%。当再加上一些官方公布的前置问题背景信息之后,GPT-5.6 Sol的无工具得分更是直接跳到了77.2%,Claude Opus 4.8达到了74.8%。

这说明什么?这说明这些模型大概率在训练阶段就见过这些题目和答案,所以即使不去查Splunk日志,也能凭"记忆"答出大半正确答案。这种情况下,"全工具"测试里的高分,有多少是真正的调查推理能力,有多少只是"背过答案",就很难区分了。

不同模型的无工具得分差距也耐人寻味——GPT-5.6 Luna、Terra以及Claude Fable 5的无工具得分都在13%到19%之间,远低于Opus 4.8和Sol,说明污染程度在不同模型之间差异显著,并不是一个可以用统一修正系数处理的问题。

研究团队明确指出:BOTS v1这套数据作为"可复现的评测框架"和"成本核算实验台"依然有价值,但如果要把它的绝对分数当作模型"真实调查能力"的证明,就必须同时提供这类无工具测试的对照数据,否则数字会产生严重误导。

八、结论:不同的活,不同的钱该怎么花

说到底,这篇研究最核心的结论可以用两句话概括:进攻型AI任务,多给钱能换来更高成功率;防守型AI任务,多给钱基本买不来更高准确率,能力的高下更多取决于模型本身的"判断力"。

从实际操作层面看,这意味着如果你要部署AI做红队演练,你需要为模型预留足够的计算预算,并且要接受不同模型之间存在严格程度差异迥异的安全过滤;如果你要部署AI辅助安全分析师做日志调查,砸更多钱在查询次数上可能适得其反,应该更关注模型的工具使用效率和"知道什么时候该停下来"的判断能力。

对于整个行业来说,这篇研究发出了一个清晰的信号:安全AI的评测不应该只比"谁的分数最高",应该比"谁在给定预算内的分数最高",还应该比"谁的分数是靠真本事得来的,而不是靠背答案"。设计真正有参考价值的防守型AI测评,需要使用私有数据集、定期更新题目,或者至少必须强制配套无工具基准对照。

这项研究的局限也值得一提:它目前只覆盖了BOTS v1的31道题,后续的BOTS v2(51题,覆盖企业入侵场景)和v3(58题,云环境)尚未纳入,研究团队表示这是明确的后续工作方向。此外,各模型之间的实验条件并非完全均一,部分比较属于观察性分析而非严格对照实验。

对于关心AI能否真正替代或增强安全分析师能力的读者,这项研究提供了一个非常务实的视角:不是"AI能不能做安全",而是"什么样的AI,在什么预算下,做什么样的安全工作,效率更高"。有兴趣深入了解的读者可以通过arXiv编号2507.15263查阅完整论文,或访问研究团队的评测结果网站evals.frontier.security查看交互式数据。

Q&A

Q1:在进攻型安全测试Cybench中,为什么Claude Fable 5的成功率是0%?

A:Claude Fable 5在Cybench测试中的117次运行里,每一次都被模型自身的安全过滤机制拦截,直接拒绝参与任何涉及黑客技术的题目。这不是能力问题,而是模型的内容安全策略认为这类进攻性任务属于有害内容,因此在没有调用任何工具的情况下就直接终止了任务。这类模型在合法的安全研究场景中会成为实际使用障碍。

Q2:BOTS v1防守测试的结果为什么不能直接当作模型真实调查能力的衡量标准?

A:BOTS v1是2017年发布的公开数据集,这些题目的答案很可能已经包含在AI模型的训练数据中。研究团队的无工具测试证实了这一点——GPT-5.5在不查任何日志的情况下,仅凭问题文本就能答对54.9%的题目,加入背景信息后更高。这说明部分高分来自"背过答案"而非真正的调查推理,因此BOTS v1的绝对分数在没有对照实验的情况下无法代表模型的真实防守能力。

Q3:为什么防守型安全AI任务加大预算也不能提高得分?

A:在安全运营中心做日志调查时,核心能力是判断该看哪条数据、什么时候已经有足够信息可以得出结论,而不是把所有工具都调用一遍。研究发现DeepSeek v4 Flash把预算翻倍后,工具调用次数从4450次增加到4938次,但得分只从73.0%涨到73.9%。额外的预算通常只是让模型在已经错过关键线索之后继续做无效查询,而不是帮助它做出更好的判断。

作者声明:作品含AI生成内容
举报/反馈
分享到: 微博 QQ 空间
对本文内容有合作意向?
我们将在 1 个工作日内与您联系
留言咨询