研究与基准测试/2026-09-30/28 分钟GDPval:在真实、有经济价值的任务上评测 AI 模型OpenAI 用 44 种职业、1,320 道真实任务比较模型与专家。金标准子集上 Claude Opus 4.1 有 47.6% 的交付物优于或同样好于人类;自动评分器与人类一致率 65.7%,人类互评为 70.8%。