研究与基准测试/2026-09-30/6 分钟OpenAI 与 Paradigm 发布 EVMbench:在智能合约上评测 AgentEVMbench 用 40 次审计里的 117 个高危漏洞,测 Agent 能否发现、修补和利用智能合约问题。利用模式分数涨得快,发现和修补仍然明显更难。