CodexQA

Industry & PracticeResearch & Benchmarks

告警能报,静默入侵和收尾计划不行:阿里 SecRespond 评失陷后的响应

CodexQA 团队5 min read

10 个隔离云主机快照,280 个检查点。最强的 Claude Opus 4.7 检测和计划平均只有 72.4%,而且没有任何模型在任何一个靶场上同时做完检测和处置。

In this piece

告警能报,静默入侵和收尾计划不行:阿里 SecRespond 评失陷后的响应

阿里通义实验室、阿里云计算和香港科技大学的预印本 SecRespond: Benchmarking AI Agents for Real-World Post-Compromise Incident Response,arXiv 戳记是 2026 年 7 月 29 日(2607.26791v1)。PDF 页眉写 2026-07-30。SecRespond 评的是失陷之后:主机已经被攻破,Agent 拿到磁盘快照和主机安全产品的告警、漏洞扫描、基线检查,要写出入侵、基线风险、漏洞风险三份法医报告,再加一份处置计划。它不评「在干净环境里把洞打穿」。

现有安全评测停在出事之前

CTF、漏洞发现和补丁类基准,把 Agent 放在还没被攻破的环境里找洞、利用或打补丁。防御侧又常常只给孤立告警、日志或事故报告。失陷后的工作不是这些:要在已经被改过的磁盘上把攻击链拼回来,还要处理持久化、被擦掉的痕迹和同时在跑的正常业务。SecRespond 把这件事做成 10 个网络靶场。每个靶场是一台作者自己开通、在隔离环境里做完实验、再冻结的云主机快照,不是客户或生产系统。入口类型 4 种,ATT&CK 技术 21 项,操作系统 5 种。快照里的真实口令、密钥和个人数据换成了占位符。论文写明放出的是法医证据,不是可直接拿去打真实系统的利用链,只供防御研究。

Agent 要交一个进度文件和四份报告。检查点由安全专家按靶场手写,一共 280 个,映射到 52 个能力项、五个维度:入侵实体(ENT)、持久化机制(PER)、基线风险(BAS)、漏洞风险(VUL)、调查与响应质量(Q)。不同靶场的检查点因此可以加到同一把尺子上。

每个检查点有两轴,都没有部分场景之外的主观总分。检测满分 3:发现问题、证据够不够、归因对不对。计划满分 2:处置步骤对不对、计划能不能把该清的痕迹清完。归一化是得分除以该轴满分。靶场分是该靶场、该轴上检查点归一化分的平均,再写成百分数。能力分是映射到该能力的全部检查点,达成得分除以满分。

23 个模型,同一套 OpenCode,三个裁判

23 个模型、8 个系列,含同一系列的前后版本。全部用 OpenCode,同一份输入、指令和工具,默认参数,打开推理。裁判是三个闭源模型:Claude Opus 4.7、Gemini 3.1 Pro、GPT-5.4 Pro。每个裁判也跑在 OpenCode 里,用 bash 读被测模型交的报告,按检查点打分,再对三个裁判取平均。

另外有一个不带 Agent 的传统扫描作对照,只有检测、没有计划:ENT 43.6,PER 2.1,BAS 20.7,VUL 50.0。持久化几乎扫不出来。

人工对照抽了 60 个检查点,覆盖全部 10 个靶场,每个检查点 10 条轨迹,专家看不到裁判分。检测仍是 0 到 3,计划 0 到 2。和裁判的皮尔逊相关 0.96,二次加权 κ = 0.94,平均绝对误差 0.15。98% 的检查点双方相差不超过 1 分。裁判比专家略严。论文还写,三个裁判没有把自己家的模型打得明显更高,自偏好很小;去掉任一裁判,名次不受影响。这里没有把逐条自偏好表展开。

检测高于计划,没有一个靶场被做完

摘要里最强的 Claude Opus 4.7,检测和计划平均只有 72.4%。没有任何模型在任何一个靶场上同时做完检测和处置。

按靶场平均,检测 / 计划:Claude Opus 4.7 是 79.0 / 65.7,Claude Opus 4.6 是 78.2 / 58.0,GLM-5.1 是 76.3 / 59.2,Qwen3.7 Plus 是 75.6 / 58.8。Gemini 3.1 Pro、MiniMax M2.5、Gemini 3 Flash 在文中被标成偏低的一档。GLM 和 DeepSeek 高于 GPT 与 Gemini 系列,闭源并不自动更会做这件事。

检测一律高于计划。GPT-5.5 是 70.7 对 36,差 34.7 个百分点。Claude Sonnet 4.5 的差距最小,8.5 个百分点。论文把缺口主要记成处置没做完,不是第一步就写错:常见是先说停掉异常进程或删掉落地文件,后面不再轮换已暴露的凭据、切断外联,也不确认业务在清理之后还活着。

版本大多变好,但不是每家。Claude Opus 从 4.5 的 69.5 / 56.4,到 4.6 的 78.2 / 58.0,再到 4.7 的 79.0 / 65.7。GLM-5.1 相对 GLM-5 高 11.4 / 13.3(76.3 / 59.2 对 64.9 / 45.9)。DeepSeek V4 Pro 相对 V3.2 高 14.0 / 9.8(73.2 / 53.4 对 59.2 / 43.6)。Qwen3.7 Plus 相对 Qwen3.6 Plus 高 7.2 / 10.5(75.6 / 58.8 对 68.4 / 48.3)。反向的也有:Kimi K2.6 的计划分 43.0,低于 K2.5 的 50.7;Gemini 3.1 Pro 的 54.8 / 31.5 低于 Gemini 3 Flash 的 57.4 / 32.9。

靶场难度跟着攻击链变长、变宽而上升。单入口、链条短、持久化已经出现在告警里的场景,模型分高;告警之外还有静默痕迹、还要跨服务或跨运行时对上的场景最难。论文点名最容易的一类,是模型已经熟悉的公开漏洞场景,不代表现场调查能力。Claude Opus 4.7 在其中一个靶场的每一次尝试都安全拒答,没有报告;它的总分因此只对剩下 9 个靶场平均。

五个维度上,全体模型的平均检测是入侵实体 75.4%、持久化 58.8%。平均计划最高在基线风险 55.3%,调查与响应质量只有 31.8%。Claude Opus 4.7 的五维检测 / 计划是:ENT 85.4 / 61.9,PER 67.8 / 48.7,BAS 80.8 / 74.8,VUL 76.2 / 72.6,Q 73.6 / 53.6。Claude Opus 4.6 是 86.0 / 58.1,72.1 / 45.8,78.6 / 67.6,79.2 / 63.3,68.8 / 34.4。表 5 其余行是同一口径,这篇不把 23 个模型的五维格子全部展开;上面的靶场平均已经覆盖正文点名的领先和退步。

这些数不能被读成什么

这是隔离环境里的合成快照,不是生产事故复盘,也不能外推到未覆盖的操作系统或入口。检测 3 分和计划 2 分的刻度不同,百分数已经除过满分,但仍是两轴,不能加成一个「安全能力」。72.4% 是检测和计划的平均,而且 Opus 4.7 少了一个拒答靶场。裁判是 LLM,尽管和 60 个检查点上的专家相关 0.96,换裁判、换轨迹规模都可能动。传统扫描没有计划分,不能和 Agent 的计划轴比。论文禁止把这套材料用于未授权入侵。预印本许可证是 arXiv.org perpetual non-exclusive license,这篇只复述评测口径和汇总数字,不写利用步骤。数据页由论文给出:https://github.com/Alibaba-NLP/qqr/tree/main/data/secrespond 。

出处:阿里巴巴通义实验室,Lehan Wang、Boli Chen、Ruixue Ding 等,SecRespond: Benchmarking AI Agents for Real-World Post-Compromise Incident Response,2026-07-29,https://arxiv.org/abs/2607.26791

Found it useful? Pass it on

WeChat

Scan with WeChat to open it on your phone and forward it.

Subscribe via RSS

Submit a correction