研究与基准测试/2026-09-30/28 分钟GDPval:在真实、有经济价值的任务上评测 AI 模型OpenAI 用 44 种职业、1,320 道真实任务比较模型与专家。金标准子集上 Claude Opus 4.1 有 47.6% 的交付物优于或同样好于人类;自动评分器与人类一致率 65.7%,人类互评为 70.8%。
研究与基准测试/2026-09-30/6 分钟OpenAI Cookbook:用轨迹、评测和 Codex 把 Agent 改进转起来Wesley Pasfield 在 2026 年 5 月的笔记本里搭了一条闭环:真实轨迹、人工和模型反馈、Promptfoo 评测、HALO 排序,再交给 Codex 改支架。评论先过,再考虑自动合并。
研究与基准测试/2026-09-30/6 分钟OpenAI 与 Paradigm 发布 EVMbench:在智能合约上评测 AgentEVMbench 用 40 次审计里的 117 个高危漏洞,测 Agent 能否发现、修补和利用智能合约问题。利用模式分数涨得快,发现和修补仍然明显更难。
研究与基准测试/2026-09-30/7 分钟OpenAI:SWE-bench Verified 已经测不出前沿编程能力2026 年 2 月,OpenAI 停止报告 SWE-bench Verified。抽查常失败题目后,至少 59.4% 的测试会拒绝功能正确的补丁,而且前沿模型能复述金标准补丁。
研究与基准测试/2026-09-30/6 分钟OpenAI 审计 SWE-Bench Pro:大约三成任务是坏的2026 年 7 月,OpenAI 用自动管线加五名工程师复审,估计 SWE-Bench Pro 约 30% 的任务有问题。公开子集上八个月内从 23.3% 升到 80.3%,并不能直接当成能力跃升。