Industry & PracticeResearch & Benchmarks
OpenAI 与 Paradigm 发布 EVMbench: 在 智能 合约 上 评 测 Agent
EVMbench 用 40 次审计里的 117 个高危漏洞,测 Agent 能否发现、修补和利用智能合约问题。利用模式分数涨得快,发现和修补仍然明显更难。

来源:OpenAI,2026 年 2 月 18 日《Introducing EVMbench》,与 Paradigm 联合发布。下文转述评测设计与公开结果,不提供漏洞利用方法。
智能合约锁着超过一千亿美元量级的开源加密资产。Agent 越来越会读代码、改代码、执行代码,实验室需要一个有经济含义的环境来测量这件事,并推动把模型用在防御侧:审计和加固已经部署的合约。
测什么
EVMbench 评的是 Agent 对高危智能合约漏洞的三种能力:发现(detect)、修补(patch)、利用(exploit)。题目来自 40 次审计中整理出的 117 个漏洞,多数出自公开的代码审计竞赛,另有若干来自 Tempo 这条面向稳定币支付的 L1 在安全审计中的场景。后者把基准延伸到支付类合约,也是作者认为 Agent 化稳定币支付会变多的地方。
环境不是把竞赛原文直接丢给模型。已有概念验证和部署脚本的就改编,没有的就手写。修补模式要求漏洞确实可被利用,并且修掉之后不会把编译搞坏。利用模式写了专门的评分器,并做过红队,试图堵上「不真正利用、只欺骗评分器」的路。除了 Paradigm 的领域审核,还用自动审计 Agent 提高环境可靠性。
运行支架是 Rust 写的:部署合约、确定性重放 Agent 交易、限制不安全的 RPC。利用任务跑在隔离的本地 Anvil 里,不连主网。漏洞都是已经公开、有文档的历史问题。
公开结果
三种模式都评了前沿 Agent。利用模式下,通过 Codex CLI 运行的 GPT-5.3-Codex 得到 71.0%,约六个月前的 GPT-5 是 33.3%。发现召回和修补成功率都还没有覆盖全部漏洞,很大一部分问题 Agent 仍然找不到、也修不好。
行为差异也被记下来:利用模式目标明确,一直迭代到资金被转走,所以最好做;发现模式里,Agent 常常找到一个问题就停,不会把代码库审完;修补模式要在去掉隐蔽漏洞的同时保住全部功能,仍然很难。
边界
这套基准不等于真实合约安全的全部难度。题目来自 Code4rena 一类竞赛,严重且真实,但很多重仓合约经过的审查更严,可能更难利用。
评分也不完美。发现模式只检查 Agent 是否找到人类审计员标出的同一个漏洞。若它多报了问题,目前无法可靠区分是人类漏掉的真漏洞,还是误报。利用模式把交易按顺序在评分容器里重放,依赖精确时间的行为不在范围内。链状态是干净的本地 Anvil,不是主网分叉,目前也只支持单链,有时不得不用模拟合约代替主网部署。
作者为什么要做
合约锁着大量资产,Agent 对攻击者和防御者都会有影响。测量这块能力,是为了跟踪新兴网络风险,也是为了把模型用在审计和加固上。OpenAI 在文中把 EVMbench 同时当成测量工具和行动呼吁,并重申双用途上的做法:安全训练、自动监控、高级能力的可信访问,以及威胁情报一类的执行管线。防御侧产品 Aardvark 仍在扩大非公开测试,并和开源维护者合作,为广泛使用的项目提供免费代码扫描。
原文:https://openai.com/index/introducing-evmbench
Found it useful? Pass it on
Scan with WeChat to open it on your phone and forward it.