GDPval: 在 真实、 有 经济 价值 的 任务 上 评 测 AI 模型
OpenAI 用 44 种职业、1,320 道真实任务比较模型与专家。金标准子集上 Claude Opus 4.1 有 47.6% 的交付物优于或同样好于人类;自动评分器与人类一致率 65.7%,人类互评为 70.8%。

本文目录
GDPval:在真实、有经济价值的任务上评测 AI 模型表现
Tejal Patwardhan、Rachel Dias、Elizabeth Proehl、Grace Kim、Michele Wang、Olivia Watkins、Simón Posada Fishman、Marwan Aljubeh、Phoebe Thacker、Laurance Fauconnet、Natalie S. Kim、Patrick Chao、Samuel Miserendino、Gildas Chabot、David Li、Michael Sharman、Alexandra Barr、Amelia Glaese、Jerry Tworek。OpenAI。许可证:CC BY 4.0。arXiv:2510.04374v1,2025 年 10 月 5 日。
我们提出 GDPval,一个在真实、有经济价值的任务上评测 AI 模型能力的基准。GDP(Gross Domestic Product,国内生产总值)是一国在一定时期内生产的全部最终产品与服务的市场价值。GDPval 覆盖对美国 GDP 贡献最大的 9 个行业中的 44 种职业,并覆盖美国劳工统计局(Bureau of Labor Statistics)为这些职业记录的大部分工作活动(Work Activities)。任务来自行业专业人员的代表性工作,这些专业人员平均有 14 年经验。我们发现,前沿模型在 GDPval 上的表现大致随时间线性提高,当前最强的前沿模型在交付物质量上正在接近行业专家。我们分析:当前沿模型与人工监督配合时,完成 GDPval 任务有可能比无人协助的专家更便宜、更快。我们还表明,增加推理力度、增加任务上下文、增加支架(scaffolding,包在模型外面、负责调用工具并检查产物的程序)都会提高模型在 GDPval 上的表现。最后,我们开源一个 220 道任务的金标准子集(gold subset,经过筛选、公开、用于主要打分的子集),并在 evals.openai.com 提供公开的自动评分服务,便于后续研究真实世界中的模型能力。
1 引言
能力越来越强的 AI 模型会如何影响劳动力市场,争论正在变多:是自动化某些具体任务,取代整个职业,还是创造出全新的工作(Brynjolfsson et al., 2025; Chen et al., 2025)。现有衡量 AI 经济影响的做法,关注的是采用率、使用方式,以及归因于 AI 的 GDP 增长(Chatterji et al., 2025; Tamkin et al., 2024; Appel et al., 2025; Acemoglu, 2025; Bick et al., 2024)。然而,电力、飞机和计算机等技术变迁的历史表明,从发明到渗透整个经济往往要数年甚至数十年,并需要监管、文化和流程上的改变(David, 1990; Brynjolfsson & Hitt, 2000; Brynjolfsson et al., 2017; Dwivedi et al., 2021; Solow, 1987)。因此,这些方法在数据可得时虽然有信息量,却是 AI 影响的滞后指标。我们考虑另一种理解 AI 潜在经济影响的方法:直接测量 AI 模型能力。AI 能力评测可以提供更清楚、更能直接归因的模型能力证据,使我们能在广泛采用之前评估其经济相关性。
图 1:全集中的 GDPval 任务示例。
本文介绍 GDPval 的第一版,一个在真实、有经济价值的任务上评测 AI 模型表现的基准。GDPval 覆盖对美国 GDP 贡献最大的 9 个行业,44 种职业;全集中每种职业至少 30 道任务,金标准子集中每种职业 5 道任务。每道任务都依据专家专业人员实际做出的工作产物来构造。由于自动给这些任务打分很复杂,我们的主要评测指标是专家的一对一比较(pairwise comparison,把两份未标来源的交付物放在一起,由专家判断哪一份更好)。我们也为开源的 220 道金标准任务提供实验性的自动评分服务。后续 GDPval 版本会增加广度、真实度、交互性和上下文上的细微差别。
GDPval 的初始版本相对现有 AI 模型评测有几项优点:
真实度:不同于侧重推理难度、形式像学术考试的 AI 基准(例如 Phan et al. (2025); Hendrycks et al. (2020); Rein et al. (2023); Liu et al. (2023)),这里的任务基于行业专家的实际工作产物,经过多轮校验与审核,并绑定完成所需的时间与成本。
代表性广度:不同于只盯软件工程等特定领域的 AI 评测(例如 Miserendino et al. (2025)),GDPval 全集覆盖 44 种职业的 1,320 道任务,来源要覆盖 ONET 为每种职业记录的大部分工作活动。ONET 是美国劳工部维护的职业数据库,包含职业定义与任务(U.S. Department of Labor, Employment and Training Administration, 2024)。这种自上而下的做法使任务在职业之间具有代表性。我们也在生产环境中的 AI 使用分析之上继续做(例如 Tamkin et al. (2024); Chatterji et al. (2025); Appel et al. (2025)),覆盖模型采用仍在出现的领域。
计算机使用与多模态:任务要求操作多种格式(例如 CAD 设计文件、照片、视频、音频、社交媒体帖子、示意图、幻灯片、电子表格,以及客户支持对话)。金标准子集中每道任务还要解析最多 17 个参考文件,全集中最多 38 个。
主观性:除正确性外,专家评分者经常考虑结构、风格、格式、美观和相关性等主观因素。因此这个数据集也可用来检验自动评分器的表现。
没有“上限”:不同于可能很快饱和的指标,我们的主要指标是胜率(win rate,专家认为模型交付物优于人类交付物的比例),可以持续评测。目前我们把模型输出与人类专家基线比较;以后可以把基线换成越来越强的模型,继续评。
长程难度:专家专业人员完成一道任务平均需要 7 小时。高的一端,任务跨度可达数周。
2 任务构造
我们先找出对美国 GDP 贡献最大的行业,再从这些行业里收入最高的知识工作职业中抽取任务。
2.1 职业优先级
GDPval 覆盖 9 个行业、44 种职业的任务,这些职业合计年收入 3 万亿美元。下面说明初始版本的方法。
选择初始职业时,我们:
选出对美国 GDP 贡献超过 5% 的行业,依据是 2024 年第二季度“行业增加值占国内生产总值的百分比”(见 Federal Reserve Bank of St. Louis (2025))。这 9 个行业见表 1。
在每个行业中选出对工资与薪酬总额贡献最大、且以数字工作为主的 5 种职业。职业归入哪个行业,用的是 2023 年 BLS 全国就业矩阵(U.S. Bureau of Labor Statistics, 2025a):把每种职业映射到其就业人数最高的行业。细节见 A.7。判断一种职业是否“以数字工作为主”,我们采用基于任务的做法:从 ONET 取出该职业的全部任务。与 Eloundou et al. (2023) 类似,我们让 GPT-4o 把每条任务分成数字或非数字,若至少 60% 的组成任务是数字任务,则把该职业整体标为数字职业。计算这一百分比时,按 ONET 任务评分中每条任务的“相关性”“重要性”和“频率”加权。
我们进一步把这一数字任务度量,对照 Acemoglu & Autor (2011) 的任务内容框架做代表性校验。观察到的相关是:数字任务随非常规认知内容上升,随常规内容和手工内容下降,与既有的工作经济度量一致,见 A.7.1。
工资与职业数据使用 O*NET 的 2024 年 5 月全国就业与工资估计,计算 831 种职业的工资总额(U.S. Bureau of Labor Statistics, 2025b),细节见 A.7。
图 2:GDPval 包含来自 44 种职业的真实工作。
| 行业 | 占 GDP | 职业 | 薪酬总额(十亿美元) |
|---|---|---|---|
| 房地产及租赁 | 13.8% | 物业/房地产/社区协会经理 | 24.54 |
| 柜台与租赁办事员 | 17.42 | ||
| 房地产销售代理 | 13.53 | ||
| 房地产经纪人 | 4.55 | ||
| 礼宾 | 1.80 | ||
| 制造业 | 10.0% | 生产与操作工人的一线主管 | 51.07 |
| 采购员与采购代理 | 39.79 | ||
| 收发与库存办事员 | 38.50 | ||
| 工业工程师 | 37.79 | ||
| 机械工程师 | 31.57 | ||
| 专业、科学与技术服务 | 8.1% | 软件开发人员 | 239.18 |
| 律师 | 136.66 | ||
| 会计师与审计师 | 135.44 | ||
| 计算机与信息系统经理 | 121.44 | ||
| 项目管理专员 | 108.77 | ||
| 政府 | 11.3% | 合规官 | 33.80 |
| 行政服务经理 | 32.03 | ||
| 儿童、家庭与学校社会工作者 | 24.10 | ||
| 警务与侦探的一线主管 | 17.00 | ||
| 娱乐工作者 | 11.51 | ||
| 医疗保健与社会援助 | 7.6% | 注册护士 | 323.05 |
| 办公室/行政支持的一线主管 | 107.02 | ||
| 医疗与健康服务经理 | 77.93 | ||
| 执业护士 | 40.58 | ||
| 医疗秘书与行政助理 | 37.87 | ||
| 金融与保险 | 7.4% | 财务经理 | 147.74 |
| 客户服务代表 | 123.70 | ||
| 证券、商品与金融服务销售代理 | 52.14 | ||
| 个人理财顾问 | 43.33 | ||
| 金融与投资分析师 | 39.67 | ||
| 零售贸易 | 6.3% | 综合与运营经理 | 477.16 |
| 零售销售工人的一线主管 | 58.27 | ||
| 药剂师 | 45.12 | ||
| 私家侦探与调查员 | 2.39 | ||
| 批发贸易 | 5.8% | 批发与制造销售代表(非技术/科学) | 103.21 |
| 销售经理 | 97.16 | ||
| 批发与制造销售代表(技术/科学) | 33.66 | ||
| 非零售销售工人的一线主管 | 21.43 | ||
| 订单办事员 | 3.86 | ||
| 信息业 | 5.4% | 制片人与导演 | 16.60 |
| 编辑 | 8.18 | ||
| 新闻分析师、记者 | 4.41 | ||
| 音视频技术员 | 4.30 | ||
| 影视剪辑 | 2.41 |
表 1:行业、2024 年第二季度增加值占美国 GDP 的百分比、代表性高薪职业及薪酬总额(十亿美元)。
2.2 专家招募
我们招募行业专家,依据其职业经历构造真实任务。专家须在该职业有至少 4 年专业经验,简历要显示获得过专业认可、晋升和管理职责。专家平均有 14 年经验。参与项目还须通过视频面试、背景调查、培训和测验。专家的时间与经验获得充分报酬。部分专家的前雇主包括:Accenture、Aetna、Apple、AXA Advisors、Bank of America、Barclays、BBC News、Boeing、Budget Rent a Car、Capital One、美国疾病控制与预防中心、Citigroup、Condé Nast、CVS Pharmacy、美国国防部、Disney、Douglas Elliman、E*TRADE、美国联邦贸易委员会、General Electric、Goldman Sachs、Google、Guggenheim Partners、HBO、IBM、JPMorgan Chase、Johnson & Johnson、Kmart、Kirkland & Ellis LLP、LinkedIn、Lockheed Martin、Macy’s、麻省总医院、Meta、Microsoft、Morgan Stanley、美国国家公园管理局、NFL Network、Oracle、Paul, Weiss, Rifkind, Wharton & Garrison LLP、Prudential、PwC、Raytheon、Sally Beauty、Samsung、SAP、Scientific American、Sotheby’s、Telegraph Media Group、Thermo Fisher Scientific、TIME、Twilio、美国司法部、美国空军、美国邮政、Walgreens、Wells Fargo、White & Case LLP、Whole Foods。
2.3 任务创建
每道 GDPval 任务有两个主要部分:一项请求(常带参考文件)和一份交付物(工作产物)。专家把自己的请求对照本职业的 O*NET 职业任务分类,以保证任务覆盖广、有代表性(U.S. Bureau of Labor Statistics, 2025a)。任务特征详见 A.4。为评估任务质量,我们请职业专家按真实职业标准,给每道任务的难度、代表性、完成时间和总体质量打分。每道任务的美元价值,用估计的平均完成时间乘以该职业在 OEWS(职业就业与工资统计)中的小时工资中位数(U.S. Bureau of Labor Statistics, 2025b)。
2.4 任务质量控制流水线
图 3:任务经过多轮审核,以保证真实度和质量。
GDPval 全集的全部 1,320 道任务都经过迭代审核:既有基于模型的自动筛查,也有多阶段人类专家审核。每道任务平均得到五次人类审核(最少三次)。
(a)两两评分设置
(b)与人类的一致率
图 4:GDPval 用专家的两两比较来评分。我们也做了一个实验性自动评分器。在 GDPval 金标准子集上,自动评分器与人类的一致率,距离人类评分者之间的一致率在 5 个百分点以内。
在各审核阶段,专家都给出详细意见,任务在下一次审核前被迭代修改,以提高质量和代表性,详见 A.5。
2.5 人类专家评分与自动评分
为给开源的 220 道金标准子集打分,我们做了盲法的专家两两比较:相关职业的专家看到请求和参考文件,对两份或更多未标注的工作交付物排序。
金标准子集里,每次比较的评分平均超过一小时。另外招募职业专家,给人类交付物和模型交付物打分。专家为自己的选择和排序写出详细理由,我们据此计算各模型相对人类专家完成件的头条胜率。
对金标准子集,我们训练了一个实验性评分模型,按行业专家的方式做两两比较。自动评分器虽然有限,但比专家评分更快、更便宜,与人类专家评分者的一致率为 66%,只比人类专家之间 71% 的互评一致率低 5 个百分点。细节见 A.6。
3 实验与结果
3.1 头条结果
图 5:在人类两两比较中,模型在 GDPval 金标准子集上开始接近与行业专家持平。
图 6:OpenAI 前沿模型在 GDPval 金标准子集上的表现,大致随时间线性提高。
我们用行业专家的盲法两两比较,评测了 GPT-4o、o4-mini、o3、GPT-5、Claude Opus 4.1、Gemini 2.5 Pro 和 Grok 4。我们尽量让比较保持盲法,但模型样本仍可能因文风被认出来。OpenAI 的输出常用破折号,Claude 的输出经常用第一人称,Grok 有时自称 Grok。文件名去掉了模型标识,但为保留样本本身,我们没有改文风或内容,专家仍可能推断模型来源。Claude 通过界面采样,以便打开与 GDPval 最相关的功能,例如 Claude 的“升级的文件创建与分析”功能(https://www.anthropic.com/news/create-files)。对 OpenAI 模型,我们打开了网页搜索工具和代码解释器,并使用后台采样。基础镜像里没有的若干库也预先安装,见 A.6.4。图中每个模型对每条提示采样 3 次,再由 3 位不同的人类评分者给每个样本打分(220 道任务上,每个模型、每条提示得到 9 次比较)。Claude Opus 4.1 是 GDPval 金标准子集上表现最好的模型,尤其强在美观(例如文档排版、幻灯片版式);GPT-5 尤其强在准确性(例如仔细遵循指示、做对计算),见图 8。A.2.4 也显示这一点:GPT-5 在纯文本上更好,Claude 在 .pdf、.xlsx 和 .ppt 等文件类型上更好,视觉和美观能力更强。需要说明的是,纯文本所覆盖的职业和任务类型,往往与多模态任务不同。在图 5 中,GDPval 金标准子集上,Claude Opus 4.1 有 47.6% 的交付物被评为优于人类交付物(胜)或与之同样好(平)。模型交付物在略多于一半的任务上优于或追平专家人类的交付物。
3.2 速度与成本比较
我们分析了若干情景,以理解前沿模型在 GDPval 金标准子集任务上可能的速度与成本节省比,见 A.2.1。我们未能得到 Claude、Gemini 和 Grok 的成本估计。在所分析的情景中,把前沿 AI 模型放进专家工作流,相对无人协助的专家,有节省时间和金钱的可能。图 7 概括“先试用模型,若仍不满意就自己改”这一设置下的预期节省:专家人类向模型采样,审阅输出,若不满意就重新采样并重复;若始终得不到满意输出,人类自己完成任务。在这一设置以及其他设置下(例如直接使用模型输出,或只试一次模型再自己做),模型协助有可能为专家节省时间和金钱。
图 7:在我们分析的情景中,把 AI 协助与专家人工监督结合起来,模型有可能节省时间和金钱。这里展示的是“试 $n$ 次,若仍不满意就自己改”的速度与成本节省,细节见 A.2.1。
3.3 模型的强项与弱项
我们建了一条聚类流水线,分析专家为何接受或拒绝 GPT-5 high、Claude Opus 4.1、Gemini 2.5 Pro 和 Grok 4 的交付物,见图 8。样本按专家的书面理由聚类;标签互斥,理由不清时留空。Claude、Grok 和 Gemini 最常因不遵循指示而落败;GPT-5 high 主要因格式错误落败,不遵循指示的问题最少。Gemini 和 Grok 经常承诺交付物却没有给出,忽略参考数据,或用错格式。GPT-5 和 Grok 的准确性错误最少,不过所有模型有时都会编造数据或算错。
图 8:在各模型上,专家最常更喜欢人类交付物,是因为模型没有完全遵循 GDPval 任务的指示。
3.4 提高推理力度与支架
为理解推理力度对模型表现的影响,我们在 o3 和 GPT-5 上以低、中、高三档推理力度运行 GDPval。额外的推理力度提高了表现。
我们也想测量:用提示词能多容易地提高模型能力。例如,观察到的许多 GPT-5 失败来自明显的格式错误。我们写了一条提示,要求 GPT-5 严格检查交付物是否正确,把文件渲染成图像来检查版式,避免非标准 Unicode 字符,并避免过分冗长。这条提示一般地适用于多模态经济任务,没有过拟合到任何一道题(细节见 A.3)。我们还改进了 agent 支架:在容器里允许 GET 请求,并用 GPT-5 做评判、以 N=4 做 best-of-N 采样(从 N 份候选里挑最好的一份)。
提示把 GPT-5 回复里的黑方块伪影完全消掉了。此前超过一半生成的 PDF 受此影响。PowerPoint 文件中严重的格式错误从 86% 降到 64%。这可以部分归因于:agent 使用多模态能力检查交付物的比例从 15% 升到 97%。提示还使人类偏好胜率在图 9(b) 中提高了 5 个百分点。这些容易得到的提升说明:若通过训练或支架让 agent 更仔细,并充分使用多模态能力,在 GDPval 任务上还有改进路径。
(a)推理力度实验
(b)提示调优实验
图 9:模型表现随推理力度提高而可预期地变好。提示调优和支架改进也提高了 GPT-5 的表现。
4 开源
我们开源 220 道任务金标准子集中的提示和参考文件。人类专家比较仍是我们推荐的评分方法,同时在 evals.openai.com 公开实验性自动评分器。请注意,开源集合中的任务已去掉可能识别出任务作者的信息。另外,由于自动评分器的限制,我们并不为金标准子集中的全部任务提供自动评分结果。关于开源金标准子集的进一步声明见 A.1.3。
5 局限性
GDPval 全集目前只有 44 种职业,每种职业共 30 道任务。因此它是知识工作任务的一个有限的初始切片,不是对所有可能职业任务的全面评测。我们正在扩大数据集。
GDPval 初始版本的任务面向可以在计算机上完成的知识工作,尤其是数字交付物。当前版本不包括体力劳动和身体任务。此外,大量依赖隐性知识、需要访问个人可识别信息、使用专有软件工具,或需要人与人沟通的任务,不在当前评测范围内。我们打算在后续版本中在此基础上继续做。
对 GDPval,我们在提示里提供任务的全部上下文;但在真实生活中,弄清任务的全部上下文、理解该做什么,本身往往就要花力气。我们正在改进 GDPval,使其更有交互性、上下文更真实。在此之前,“上下文不足的 GDPval”(A.2.7)这一实验表明,上下文变少时模型表现会下降。
当前的自动评分器相对人类专家评分者有多项限制。更多细节见 A.6.2。
构造并运行这一评测很贵,尤其是使用行业专家评分者时。因此我们提供自动评分器作为代理,但不把它当作行业专家评分者的完全替代。
6 结论
在 GDPval 中,我们贡献如下:
数据集:我们建立一个新的评测数据集(GDPval),测量真实、有经济价值的任务。
能力基准:我们分析人类行业专家与前沿 AI 模型在交付物质量、速度和成本上的差别。
实验:我们检验推理力度、提示、支架和上下文变化时,结果如何移动。
开源:我们把 220 道任务作为金标准子集开源,其中包括提示和参考文件。
自动评分器:我们在 evals.openai.com 发布自动评分器,使评分更容易获得。
我们希望这项工作有助于追踪模型进展的科学研究,从而有更好的数据来评估 AI 模型的社会影响。
致谢
我们感谢 Abhishek Bhardwaj、Addea Gupta、AJ Ostrow、Aleksander Madry、Alexander Wei、Ally Bennett、Becky Waite、Ben Gaffney、Brad Lightcap、Casey Chu、Cassandra Duchan Solis、Charlotte Cole、Dane Stuckey、Eric Wallace、Erik Ritter、Evan Mays、Fidji Simo、Gideon Myles、Hannah Wong、Isa Fulford、Jakub Pachocki、James Lennon、Jared Pochtar、Jason Kwon、Jordan Frand、Julie Steele、Justin Wang、Kai Chen、Karthik Rangarajan、Kevin Liu、Larry Summers、Leo Liu、Leon Maksin、Leyton Ho、Lindsay McCallum、Livvy Pierce、Manoli Liodakis、Mark Chen、Max Schwarzer、Miles Palley、Miles Wang、Nakul Khanna、Nat McAleese、Natalie Kim、Nicholas Carlini、Nick Otis、Nick Ryder、Noam Brown、Noel Bundick、Paul Radulovic、Phillip Guo、Prashanth R、Rachel Brown、Raoul de Liedekerke、Robert Rotsted、Ronnie Chatterji、Ryan Kaufman、Ryan Rotsted、Sam Altman、Sam Bowman、Sherwin Wu、Tom Cunningham、Tom Stasi、Tony Song、Trevor Creech、Wenda Zhou、Wenlei Xie、Wyatt Thompson 和 Yara Khakbaz 的讨论、协助与审阅。我们也感谢供应商伙伴在整个研究中的合作与支持,并特别感谢为 GDPval 贡献时间与专业能力的行业专家,没有他们这项工作无法完成。
参考文献
- Acemoglu (2025) Daron Acemoglu. The simple macroeconomics of ai. Economic Policy, 40(121):13–58, 2025.
- Acemoglu & Autor (2011) Daron Acemoglu and David Autor. Skills, tasks and technologies: Implications for employment and earnings. In Handbook of labor economics, volume 4, pp. 1043–1171. Elsevier, 2011.
- Appel et al. (2025) Ruth Appel, Peter McCrory, Alex Tamkin, Michael Stern, Miles McCain, and Tyler Neylon. Anthropic economic index report: Uneven geographic and enterprise ai adoption. Anthropic Research, 2025. https://www.anthropic.com/research/anthropic-economic-index-september-2025-report
- Bick et al. (2024) Alexander Bick, Adam Blandin, and David J Deming. The rapid adoption of generative ai. Technical report, National Bureau of Economic Research, 2024.
- Brynjolfsson & Hitt (2000) Erik Brynjolfsson and Lorin M. Hitt. Beyond computation: Information technology, organizational transformation and business performance. Journal of Economic Perspectives, 14(4):23–48, 2000. doi: 10.1257/jep.14.4.23.
- Brynjolfsson et al. (2017) Erik Brynjolfsson, Daniel Rock, and Chad Syverson. Artificial intelligence and the modern productivity paradox: A clash of expectations and statistics. Working Paper 24001, National Bureau of Economic Research, November 2017. http://www.nber.org/papers/w24001
- Brynjolfsson et al. (2025) Erik Brynjolfsson, Danielle Li, and Lindsey Raymond. Generative ai at work. The Quarterly Journal of Economics, 140(2):889–942, 2025.
- Chatterji et al. (2025) Aaron Chatterji, Thomas Cunningham, David J Deming, Zoe Hitzig, Christopher Ong, Carl Yan Shan, and Kevin Wadman. How people use chatgpt. Working Paper 34255, National Bureau of Economic Research, September 2025. http://www.nber.org/papers/w34255
- Chen et al. (2025) Wilbur Xinyuan Chen, Suraj Srinivasan, and Saleh Zakerinia. Displacement or complementarity?: The labor market impact of generative ai. Harvard Business School, 2025.
- David (1990) Paul A. David. The dynamo and the computer: An historical perspective on the modern productivity paradox. American Economic Review, 80(2):355–361, 1990.
- Dwivedi et al. (2021) Yogesh K Dwivedi 等. Artificial intelligence (ai): Multidisciplinary perspectives on emerging challenges, opportunities, and agenda for research, practice and policy. International journal of information management, 57:101994, 2021.
- Eloundou et al. (2023) Tyna Eloundou, Sam Manning, Pamela Mishkin, and Daniel Rock. Gpts are gpts: An early look at the labor market impact potential of large language models, 2023. https://arxiv.org/abs/2303.10130
- Federal Reserve Bank of St. Louis (2025) Value added by industry as a percentage of gross domestic product. FRED Release Tables, 2025. https://fred.stlouisfed.org/release/tables?rid=331&eid=211 访问日期:2025-09-03。
- Hendrycks et al. (2020) Measuring massive multitask language understanding. arXiv:2009.03300.
- Liu et al. (2023) Agentbench: Evaluating llms as agents. arXiv:2308.03688.
- Miserendino et al. (2025) Samuel Miserendino, Michele Wang, Tejal Patwardhan, and Johannes Heidecke. Swe-lancer: Can frontier LLMs earn $1 million from real-world freelance software engineering? arXiv:2502.12115.
- Panickssery et al. (2024) Arjun Panickssery, Samuel R. Bowman, and Shi Feng. Llm evaluators recognize and favor their own generations. https://arxiv.org/abs/2404.13076
- Phan et al. (2025) Long Phan et al. Humanity’s last exam. arXiv:2501.14249.
- Rein et al. (2023) GPQA: A graduate-level google-proof q&a benchmark. arXiv:2311.12022.
- Solow (1987) Robert M. Solow. We’d better watch out. New York Times Book Review, pp. 36, July 1987.
- Tamkin et al. (2024) Clio: Privacy-preserving insights into real-world ai use. arXiv:2412.13678.
- U.S. Bureau of Labor Statistics (2025a) Occupational outlook – occupational data. https://www.bls.gov/emp/data/occupational-data.htm 访问日期:2025-09-03。
- U.S. Bureau of Labor Statistics (2025b) Occupational employment and wage statistics: May 2024 national tables. https://www.bls.gov/oes/tables.htm 数据为 2024 年 5 月;访问日期:2025-09-03。
- U.S. Department of Labor, Employment and Training Administration (2024) Work activities - O*NET 28.3 data dictionary. https://www.onetcenter.org/dictionary/28.3/excel/task_ratings.html 访问日期:2025-04-20。
附录 A
A.1 披露
#### A.1.1 AI 使用披露
我们使用 AI 模型协助文献回顾和调整论文措辞。工程流程中也使用 AI 编程助手(例如帮助查找和修复缺陷)。
#### A.1.2 敏感内容与政治内容披露
GDPval 中部分任务包含不适宜工作场所的内容,主题包括性、酒精、粗俗语言和政治内容。我们保留这些任务,因为它们反映多种职业(例如电影、文学、法律、政治)中真实会处理的主题。我们不认可其中任何内容的具体行为或观点。
#### A.1.3 第三方指称披露
GDPval 含有有限的第三方品牌和商标指称,仅用于研究与评测。不表示隶属或背书。所有商标归各自所有者。本数据集中的一些图像和视频包含 AI 生成的人物,以及已授权的真人。GDPval 中私人个体的姓名和可识别指称为虚构。与真实人物或实体的任何相似纯属巧合。
A.2 实验结果的补充细节
#### A.2.1 速度与成本分析(续)
定义如下。
人类专家专业人员完成时间 $H_{T}$:专家专业人员完成任务的时间,基于经过校验的自我报告完成时间。提交时,专家自我报告真实世界中完成每道任务所需时间。多名职业审核者独立校验这些时间并改正错误。因为时间是自我报告的,专家有可能低估或高估。人类专家专业人员完成成本 $H_{C}$:把各职业报告的任务完成小时数,乘以美国劳工统计局该职业的小时工资中位数(2025b)。因为我们的专家是按本领域高度资深来招募的,这些工资估计很可能低估其真实市场成本。在 220 道金标准子集上,平均 $H_{T}=404$ 分钟,$H_{C}=\$361$。
人类专家专业人员审阅时间 $R_{T}$:人类专家评分者评估一份模型交付物的估计时间。我们从任务监控软件观察:对每位人类专家第一次被要求给该题打分所花时间取平均。平均 $R_{T}=109$ 分钟,相应审阅成本 $R_{C}$ 平均为 $\$86$。$R_{C}$ 同样是时间乘以工资中位数。
模型完成时间 $M_{T}$:模型完成交付物的时间。$M_{C}$ 是相应完成成本,依据模型在给定提示下完成交付物的经验 API 速度和成本。对每道任务,我们为每个模型收集三次 API 完成,对 API 元数据中记录的响应时间取平均,并记录每道任务的平均账单成本。
模型胜率 $w$:人类专家评分者认为模型交付物优于人类交付物的频率。
然后计算下列比值。
朴素比值:不计入质量差异或落地时间,只把人类平均完成时间除以模型平均采样时间:$H_{T}/M_{T}$;成本类似:$H_{C}/M_{C}$。
试 1 次再自己改的比值:时间上,取模型采样时间,加上专家评估质量的审阅时间 $R_{T}$,再以概率 $(1-w_{i})$ 加上该模型在任务 $i$ 上需要人工补做的人类完成时间,得到 $T_{1,i}$,成本 $C_{1,i}$ 类似:
$$\mathbb{E}[T_{1,i}]=M_{T,i}+R_{T,i}+(1-w_{i})H_{T,i}$$
$$\mathbb{E}[C_{1,i}]=M_{C,i}+R_{C,i}+(1-w_{i})H_{C,i}$$
对全部任务 $i$ 取边际后的平均时间为 $T_{1}=\mathbb{E}[T_{1,i}]$,成本 $C_{1}$ 同样。这近似于:人先试着用 GPT-5 做任务,评估质量,若交付物低于自己的质量线就自己做。时间节省比的插入估计为 $H_{T}/(M_{T}+R_{T}+(1-w)H_{T})=H_{T}/\hat{T}_{1}$,其中 $\hat{T}_{1}$ 是经验均值。成本比类似:$H_{C}/(M_{C}+R_{C}+(1-w)H_{C})$。
试 $n$ 次再自己改的比值:取模型采样时间,加上专家审阅时间 $R_{T}$,再按 $(1-w_{i})$ 加入需要人工补做的人类完成时间。这里对模型偏严:每一轮之后胜率很可能上升(专业人员会改提示来修错误),审阅时间也会随对任务更熟而下降。在人类接手之前,重复 $n$ 次重采样和再评估:
$$\mathbb{E}[T_{n,i}]=\sum_{k=1}^{n}\bigl((1-w_{i})^{k-1}(M_{T,i}+R_{T,i})\bigr)+(1-w_{i})^{n}H_{T,i}$$
$$=\left(M_{T,i}+R_{T,i}\right)\frac{1-(1-w_{i})^{n}}{w_{i}}+(1-w_{i})^{n}H_{T,i}$$
$$\mathbb{E}[C_{n,i}]=\left(M_{C,i}+R_{C,i}\right)\frac{1-(1-w_{i})^{n}}{w_{i}}+(1-w_{i})^{n}H_{C,i}$$
这近似于:人对一道任务做 $n$ 轮 GPT-5,每次评估质量,若全部尝试后仍低于质量线就自己做。同样,$T_{n}=\mathbb{E}[T_{n,i}]$。因此当 $n\to\infty$ 且 $w>0$ 时,时间节省为比人类专家快 $H_{T}/((M_{T}+R_{T})/w)$ 倍,成本节省为便宜 $H_{C}/((M_{C}+R_{C})/w)$ 倍。
表 2:不同审阅策略下的速度与成本改进。
| 模型 | 胜率 | 速度·朴素 | 速度·试 1 次 | 速度·试 $n$ 次 | 成本·朴素 | 成本·试 1 次 | 成本·试 $n$ 次 |
|---|---|---|---|---|---|---|---|
| gpt-4o | 12.5% | 327x | 0.87x | 0.46x | 5172x | 0.90x | 0.53x |
| o4-mini | 29.1% | 186x | 1.02x | 1.06x | 1265x | 1.06x | 1.22x |
| o3 | 35.2% | 161x | 1.08x | 1.28x | 480x | 1.13x | 1.47x |
| gpt-5 | 39.0% | 90x | 1.12x | 1.39x | 474x | 1.18x | 1.63x |
把审阅和返工时间算进去之后,使用模型的回报会缩小。我们没有计入审阅人类专业人员交付物的时间,尽管 GDPval 中的任务通常会发生这种审阅(专业人员审自己的工作,或主管审团队成员的工作)。我们也没有计入人类交付物同样不理想的可能。这一分析的另一项限制是:它没有捕捉灾难性错误的成本,而在某些领域这种成本会不成比例地高。
#### A.2.2 分行业胜率
图 10 给出分行业胜率。结果因行业而异。有些行业所有模型的胜率都低;在另一些行业(例如政府、零售贸易和批发贸易),最强模型在 GDPval 任务上接近持平。
图 10:分行业胜率。
#### A.2.3 分职业胜率
图 11 给出分职业胜率。结果不同:有些职业在所有模型上胜率都持续偏低,另一些职业则多个模型接近持平。
图 11:分职业胜率。
#### A.2.4 分交付物胜率
图 12 按交付物类型报告胜率。不同格式表现不同。除纯文本外,Claude 在所有交付物上结果最好。GPT-5 high 在纯文本输出上领先,但总体胜率仍然低。
图 12:按交付文件类型的胜率。
#### A.2.5 按完成时间的胜率
图 13 按任务时长报告胜率。较短任务(0–2 小时)胜率最高,并随完成时间增加而稳定下降。这表明模型在更快、耗时更少的任务上表现最好。
图 13:按完成任务时间的胜率。
#### A.2.6 模型失败分析的补充
我们取 GPT-5 失败的子集(GPT-5 交付物输给人类专家的任务),再请其他职业专家评分者把这些样本评为:
灾难性:若在真实生活中使用,模型完成件会是灾难性的,因为它有害或危险地错误(例如侮辱客户、给出错误诊断、建议欺诈,或建议会造成身体伤害的行动)。
差:完成件差、不适合使用,但并不冒犯或危险(例如胡言乱语、完全不相关或语无伦次)。
可接受但次优:完成件可接受(可以使用),但人类做出了更强的回应(例如模型回应相对人类缺少有用细节)。
不适用:不同意原专家评分者;模型完成件优于人类完成件。
图 14:专家按失败严重程度给 GPT-5 的模型失败分类。
GPT-5 模型失败最常见的分类是“可接受但次优”。另有大约 29% 的评分属于差或灾难性(其中大约 3% 的失败被标为灾难性)。“模型更好”的评分约占 23%,大致对应图 4(b) 中观察到的评分者间一致水平。
#### A.2.7 上下文不足的 GDPval
为评估模型如何处理任务含糊性,我们做了一个故意降低上下文的 GDPval 修改版。这些更短的提示省去额外上下文,例如参考文件里具体数据在哪里、该如何着手,或对最终交付物的详细格式期望;模型必须“自己弄清楚”。按 token 数,这些修订提示平均是原提示长度的 42%。
这一设置帮助测量我们的评测此前没有覆盖的职业知识工作的一个方面:通过弄清该做什么、去哪里拿必要输入,来应对含糊性。我们收集 GPT-5 的完成件并由人类专家评分,发现模型在规格不足的提示上表现更差。模型尤其难在弄清上下文。
说明:这一实验跑在更早一版 GDPval 金标准子集上,因此观察到的胜率与正文不一致。
图 15:在规格不足的 GDPval 上,GPT-5 表现更差,因为它难以弄清所需上下文。
A.3 提示调优的补充细节
下面是我们给 agent 以引出能力的提示(略作编辑,去掉支架设置中的一些具体细节)。
我们做 best-of-N 采样的方式是:把提示、参考文件和四份不同提交的交付文件交给一个 GPT-5 评分者,请它选出最好的一份。
提示原文要点(按原文顺序,未改步骤):
特殊字符:不要使用字符 ‑(U+2011),因为它在一些人的计算机上渲染很差;始终改用 -(U+002D)。除非有极充分的理由,避免 emoji、非标准项目符号和其他特殊字符。
嵌入 PDF/幻灯片的图形:图或图示要大到可读(但不要大到难看或被裁切)。多数情况下至少应为页宽的一半。用图和图表展示数据是好的。简单图形(如带箭头的流程图)是好的。把形状叠成图像的复杂视觉效果常常显得不专业。
PDF:始终用 LibreOffice 创建 PDF(必须是 LibreOffice;若未安装,可以自己安装)。其他库有时会在一些计算机上显示奇怪伪影。
字体:始终使用各平台都有的字体。除非有极充分理由,推荐 Noto Sans/Noto Serif。若必须用其他字体,把字体嵌入 pptx/word 等文档。
交付物文本:不要在交付物文本里链接到提交的文件(查看界面不支持链接)。理想的交付物文本简洁、切题,没有多余空话,最多 4 句。用户要求的任何交付物都应放在容器内的文件里,而不是只写在交付物文本里。若任务有一部分无法完成(例如因为没有互联网),在交付物文本里说明。提交应当完整、自包含。即使因环境限制不能完全完成任务,也要做出尽可能接近完整的解。
冗长度:始终清楚、完整,但尽可能避免额外冗长。
文件类型:若提示没有要求特定文件类型,使用 PDF、PPTX、DOCX、XLSX、MP4、ZIP 等“标准”类型。
视频文件(mp4、mov):从视频抽出一串图像,检查视觉元素是否损坏。
提交前必须做的格式检查,按顺序、不得跳步:
- 用 LibreOffice 把所有视觉交付物转成 PNG。包括 pptx、docx、pdf、xlsx 等。每一页或每一张幻灯片单独一张 PNG。这一步是强制的;跳过即任务失败(除非没有视觉交付物)。仍须把原始格式的原始交付物提交给用户,转 PNG 只为检查格式。
- 显示这些 PNG。检查文字或图形是否被裁切、重叠、变形、空白、难读(深色字配深色底,或浅色字配浅色底),或格式很差。仔细看每一张图,需要时放大。看到的图像是整张幻灯片,因此任何文字或图形被裁切都是交付物的错误。
- 程序化格式检查。对高度视觉化的提交(例如 pptx、pdf),写程序检查:没有空白页,文字/图形没有超出页面,没有重叠的文字或图形(有意重叠除外)。若有页数或幻灯片数量限制,也要检查是否遵守。
- 概括提示中的交付物指示,并对照交付物中回应它的那一部分。
- 提交前确认产出的交付物正是想提交的:交付物应恰好包含想提交的文件,没有多余文件。打开每一个,确认没有损坏、格式良好。
若任一检查发现格式问题,修好并重新走第 1–5 步。不限时间,逐张幻灯片或逐页做。每个格式错误都是必须修复的重大问题。最后,在输出文本的最后一行加上 CONFIDENCE[XX],XX 为 0 到 100 的整数(含端点),表示对“提交正确、遵循指示且格式良好”的把握。
A.4 任务特征的补充
表 3:GDPval 金标准子集任务的汇总统计。
| 均值 | 标准差 | 最小 | 25% | 50% | 75% | 最大 | |
|---|---|---|---|---|---|---|---|
| 总体质量(1–5) | 4.47 | 0.32 | 3.18 | 4.30 | 4.50 | 4.70 | 5.00 |
| 难度(1–5) | 3.32 | 0.95 | 1.00 | 3.00 | 3.00 | 4.00 | 5.00 |
| 代表性(1–5) | 4.50 | 0.74 | 2.00 | 4.00 | 5.00 | 5.00 | 5.00 |
| 平均完成时间(小时) | 9.49 | 13.75 | 0.50 | 2.38 | 5.00 | 10.00 | 100.00 |
| 任务美元价值 | 398.46 | 599.45 | 12.59 | 93.72 | 174.81 | 386.03 | 4,114.20 |
表 4:GDPval 全集任务的汇总统计。
| 均值 | 标准差 | 最小 | 25% | 50% | 75% | 最大 | |
|---|---|---|---|---|---|---|---|
| 总体质量(1–5) | 4.55 | 0.43 | 2.00 | 4.33 | 4.56 | 5.00 | 5.00 |
| 难度(1–5) | 3.20 | 0.92 | 1.00 | 3.00 | 3.00 | 4.00 | 5.00 |
| 代表性(1–5) | 4.43 | 0.76 | 1.00 | 4.00 | 5.00 | 5.00 | 5.00 |
| 平均完成时间(小时) | 8.63 | 24.70 | 0.25 | 2.00 | 4.00 | 8.00 | 605.00 |
| 任务美元价值 | 391.44 | 1,296.67 | 8.53 | 70.70 | 147.31 | 354.12 | 32,028.70 |
#### A.4.1 文件与附件
许多传统评测依赖文本进、文本出。GDPval 任务纳入多种真实文件类型(电子表格、文档、演示文稿、图像、音频、视频,以及 CAD 等专门格式)。67.7% 的任务要求与至少一个参考文件交互。
表 5:GDPval 金标准集任务的文件数量。
| 均值 | 标准差 | 最小 | 25% | 50% | 75% | 最大 | |
|---|---|---|---|---|---|---|---|
| 参考文件 | 1.92 | 3.47 | 0.00 | 0.00 | 1.00 | 2.00 | 38.00 |
| 交付文件 | 1.54 | 2.64 | 0.00 | 1.00 | 1.00 | 1.00 | 36.00 |
#### A.4.2 O*NET 任务、技能与工作活动
为保证职业代表性,我们分析 GDPval 任务所代表的 ONET 任务、技能和一般工作活动。数据集覆盖 208 个互不重复的 ONET 任务、25 项职业技能和 26 项工作活动。多数 GDPval 任务涉及多项 O*NET 任务、技能和工作活动。
表 6:金标准集对 ONET 任务、技能和工作活动的覆盖。*
| O*NET 中的互不重复总数 | 金标准子集中的数量 | 覆盖率 | |
|---|---|---|---|
| O*NET 技能 | 35 | 25 | 71.4% |
| O*NET 工作活动 | 41 | 26 | 63.4% |
| O*NET 任务 | 1,470 | 208 | 14.15% |
#### A.4.3 任务规格化程度
做人类评分的职业专家,对每条提示中指示的具体程度打分。89.07% 的任务被评为规格充分,表示指示与真实世界对清晰度和细节的期望接近。
表 7:任务规格化得分。
| 标签 | 金标准集占比 | 全集占比 |
|---|---|---|
| 规格不足 | 8.28% | 8.41% |
| 规格充分 | 89.07% | 89.34% |
| 规格过度 | 2.66% | 2.26% |
#### A.4.4 任务代表性
资格:技术与知识产权律师,在纽约和加利福尼亚多家 AmLaw 100 律所任合伙人,15 年以上经验,为客户提供新兴技术、广告、反垄断和跨境争议与交易方面的意见。原话:法律任务里的细节像实务,例如含糊的事实模式、在披露相关法律考量的同时给出非法律的商业目标,以及真实的参考文件。
资格:护理专业人员,18 年以上急诊、肾脏管理、照护协调和医疗运营经验,擅长质量保证、个案管理和专业教育。原话:这些任务抓住了这一角色的复杂度,既要听清医生的话,也要仔细注意临床准确性和专业格式。
资格:战略零售高管,15 年经验,通过全国客户领导、超过 10 亿美元的损益责任和数据驱动的全渠道策略,发展高端和小众美妆品牌。原话:这些任务就是我经常做的工作,包括做收入预测、竞争分析、高管级演示,以及为全球组织内的关键零售伙伴推动战略举措。
资格:金融科技与华尔街负责人,20 年以上财富管理、资产管理和资本市场经验,跨越全球机构和初创公司。原话:它们反映的是有细微差别、因人而异的真实场景,只有在该领域有多年经验的人才能完全理解。任务中的语言和细节直接来自实际行业实务。
资格:面向美国、中国和瑞典品牌/工厂的美国全国客户销售经理,向美国零售商销售超过 25 年。原话:所有任务事实上都基于真实世界任务,并带有备份参考文件和真实数据。
资格:首席工业工程师,5 年以上经验,管理大规模项目并领导 10 人以上的工业运营工程师团队。原话:重新设计任务特别像真实实务,因为它们包含具体设计部件和块,以及带精确尺寸的详细图纸。它们强调可见性和优化步行距离以提高整体生产率,正是实际工程和运营所关注的细节。
资格:高管,15 年以上在政府和非营利部门的战略与运营层工作,领域为住房、人类服务和劳动力市场项目。原话:许多任务要求整合多种信息来源、做有细微差别的决策,并把工作调整到我们在职场服务的不同对象。
资格:资深商业房地产经纪人,10 年投资销售、租赁以及管理房地产办公室和经纪人的经验。原话:这些任务抓住了特定行业和场景所独有的动态与专业知识。
资格:资深高级记者和内容负责人,20 年以上顶级媒体、全球公司和高增长初创公司经验。原话:最重要的是,任务锚定在真实世界的挑战和职场目标上。它们要越过障碍、达成职场目标,并交付真实的解决方案和产品。
专家资格的补充:不到 10% 的申请人被选中为全集贡献任务。行业专家也带来职业多样性,代表不同公司规模、地点和子专业。每种职业至少有 5 名合格专业人员。每种职业的专家须按 O*NET 职业定义,具备该职业和该行业的既往经验(U.S. Bureau of Labor Statistics, 2025a)。
A.5 任务质量控制的进一步细节
#### A.5.1 模型在环的任务审核
我们用 OpenAI 模型按多项标准自动筛查每次任务提交,并标出可能的错误或遗漏:任务是否与所选 O*NET 职业相关;请求是否主要为在计算机上完成的任务;任务复杂度是否太简单(例如看起来像 5 分钟的工作,而不是更长期的一件工作);是否没有附上交付物和参考文件。
因为模型会出错,专家被要求把模型反馈当作建议而不是指令。任务是否准确、完整,最终责任在专家;模型不会自主修改任务。
#### A.5.2 人类专家审核者
人类审核者对每道任务做多轮审核。审核者主要来自原专家池中任务创建表现突出的人。起初,研究人员手工审阅全部任务,找出持续产出高质量任务的专家;这些人接受培训并晋升为审核者。最熟练的审核者进一步被培训为首席审核者,负责从专家池中识别、指导并晋升更多合格审核者。整个审核过程中,研究团队定期对审核者签字通过的任务做质量控制,以保持对齐和质量标准。
#### A.5.3 迭代审核过程
迭代审核至少包含下列 3 个阶段:
通才初审:通才审核者确认任务符合项目要求。
职业专家审核:该职业的审核者评估任务对该职业的代表性,并确认另一位该职业成员在所给上下文下能够完成该任务。
最终迭代反馈环:第三位专家审核者提供迭代反馈,并与专家一起改,直到任务达到严格的质量标准。
A.6 自动评分器细节
#### A.6.1 自动评分器的一致率指标
为测量自动评分器表现,我们测量自动评分器与人类专家评分者对同一样本所给分数的一致率,并比较给过同一样本的人类专家之间的评分一致率。
对样本 $s$,人类分数 $H$ 和自动评分器分数 $A$ 取值于 $\{0,0.5,1\}$:$1$ 表示偏好模型交付物,$0$ 表示偏好人类交付物,$0.5$ 表示平局。人类与自动评分器的一致定义为
$$A_{s}^{\mathrm{HA}}=\mathbb{E}\bigl[1-|H-A|\bigr].$$
模型层面的人类–自动评分器一致率,是该模型全部样本上 $A_{s}^{\mathrm{HA}}$ 的均值。
对样本 $s$,两个人类分数 $H_{1}$、$H_{2}$ 取值于 $\{0,0.5,1\}$。人类评分者间一致率是对两次随机抽取的人类评分的如下期望:
$$A_{s}^{\mathrm{HH}}=\mathbb{E}\bigl[1-|H_{1}-H_{2}|\bigr].$$
对一个样本,用该样本上所有评分配对的经验均值估计这一量。一个模型的最终人类评分者间一致率,是至少有两名人类评分者的全部样本上、这些样本级分数的均值。Cohen’s kappa、Fleiss’ kappa 和 Krippendorff’s alpha 等既有评分者间信度统计在这里不那么直接适用,因为评分者输出的是 $\{0,0.5,1\}$ 上的有序分数。
#### A.6.2 自动评分器的相关结果
在数据集上做了三轮自动评分器扫描。指标在自动评分器没有遇到系统错误并返回有效分数的全部样本上计算。我们还排除了 12 道任务(开源评测集 220 道中的 12 道),自动评分器经常无法给它们打分,或因其后文所述的限制而不太可能可靠打分。人类–自动评分器平均一致率为 65.7%,人类评分者间一致率为 70.8%。图中 95% 置信区间由自助法得到:对每个样本可用的自动评分器分数或人类评分做有放回重抽样,计算每个样本的均值,再对全部样本或指定模型取平均。
我们的自动评分器基于 GPT-5-high。在评估能力较强的 OpenAI 模型的输出时,它与人类专家评分者的相关更低。这与“模型常常偏爱自己的回答”的经验证据一致(Panickssery et al., 2024)。两种一致率指标都在能力较弱的模型上最高,因为它们的输出更容易与人类交付物区分,也更不容易被选中。
图 16:人类–自动评分器的平均一致率,在非 OpenAI 模型上与人类评分者间一致率最接近。两种一致率都在能力较弱的模型上最高,因为它们更常能与人类交付物区分开,也更不容易被选中。
#### A.6.3 自动评分器的限制
在开源集中,我们把 220 道任务里的 12 道标为无法评分,原因是自动评分器的限制。
互联网:严格需要互联网的任务(例如要求 agent 在线找音乐并下载)无法评分,因为评分器没有互联网访问。
Python:自动评分器在只允许运行 Python 的容器里工作。因此我们排除了 3 道软件开发任务,它们需要运行其他语言并下载外部依赖才能正确测试。
字体包:虽然自动评分器有大多数度量上相同的字体(例如用 Liberation Sans 代替 Arial),人类交付物使用的一些字体包仍会使某些交付物的渲染,与安装了这些字体的计算机上的样子不同。
语音转文字:自动评分器在容器内的语音转文字能力有限,并且难以处理非语音声音。
#### A.6.4 自动评分器的软件包
为让模型能处理 GDPval 中的多种文件类型,基础生产 Docker 镜像预装下列软件包。OpenAI 模型采样时,这些包也对 agent 可用。
jupyter-client==8.6.1,jupyter-core==5.5.1,jupyter-server==2.14.0,jupyterlab==4.1.8,jupyterlab-pygments==0.3.0,jupyterlab-server==2.27.1,aiohttp==3.9.5,hypercorn==0.14.3,notebook==6.5.1,nbclassic==0.4.5,pydantic==1.10.2,fastapi[all]==0.95.2,websockets==10.3,tqdm==4.64.0,matplotlib==3.6.3,matplotlib-venn==0.11.6,numpy==1.24.0,numpy-financial==1.0.0,scipy==1.14.1,pandas==1.5.3,statsmodels==0.13.5,sympy==1.13.1,seaborn==0.11.2,scikit-learn==1.1.3,nltk==3.9.1,plotnine==0.10.1,shapely==1.7.1,fiona==1.9.2,geopandas==0.10.2,ffmpeg-python==0.2.0,pydub==0.25.1,moviepy==1.0.3,opencv-python==4.5.5.62,Pillow==9.1.0,python-docx==0.8.11,python-pptx==0.6.21,openpyxl==3.0.10,xml-python==0.4.3,geopy==2.2.0,scikit-image==0.20.0,folium==0.12.1,wordcloud==1.9.2,faker==8.13.2,fpdf2==2.8.3,soundfile==0.10.2,kerykeion==2.1.16,pdfkit==0.6.1,pycountry==20.7.3,countryinfo==0.1.2,tabulate==0.9.0,shap==0.39.0,pylog==1.1,pyprover==0.5.6,pytesseract==0.3.8,qrcode==7.3,basemap==1.3.9,pygraphviz==1.7,networkx==2.8.8,pyttsx3==2.90,nashpy==0.0.35,docx2txt==0.8,typing-extensions==4.10.0,torch==2.5.1,torchaudio==2.5.1,torchtext==0.18.0,torchvision==0.20.1,PyMuPDF==1.21.1,pdf2image==1.16.3,pyth3==0.7,h5py==3.8.0,tables==3.8.0,rarfile==4.0,odfpy==1.4.1,pymc==4.0.1,jax==0.2.28,pyxlsb==1.0.8,keras==2.6.0,xgboost==1.4.2,loguru==0.5.3,plotly==5.3.0,graphviz==0.17,fuzzywuzzy==0.18.0,pydot==1.4.2,gensim==4.3.1,pypandoc==1.6.3,einops==0.3.2,reportlab==3.6.12,gradio==2.2.15,mutagen==1.45.1,librosa==0.8.1,svglib==1.1.0,gtts==2.2.3,textblob==0.15.3,rasterio==1.3.3,rdflib==6.0.0,rdkit==2024.9.6,biopython==1.84,cairosvg==2.5.2,markdownify==0.9.3,anytree==2.8.0,pdfplumber==0.6.2,trimesh==3.9.29,svgwrite==1.4.1,pdfrw==0.4,pyzbar==0.1.8,dlib==19.24.2,mtcnn==0.1.1,imgkit==1.2.2,chardet==3.0.4,bokeh==2.4.0,tabula==1.0.5,camelot-py==0.10.1,exchange_calendars==3.4,weasyprint==53.3,pronouncing==0.2.0,cryptography==3.4.8,spacy==3.4.4,requests==2.31.0,mne==0.23.4,pyopenssl==21.0.0,snowflake-connector-python==2.7.12,databricks-sql-connector==0.9.1,ddtrace~=2.8.1,datadog~=0.49.1,pytest~=8.2.0,pytest-cov~=5.0.0,pytest-json-report~=1.5.0,coverage~=7.5.1,pytest-asyncio~=0.23.6,catboost~=1.2.7,lightgbm~=4.5.0,imblearn~=0.0,imbalanced-learn~=0.12.3,rapidfuzz~=3.10.1。
我们另外安装了下列软件包,并在提示中告诉模型可以使用它们:libreoffice,aspose-words==25.8.0,av==11.0.0,cadquery==2.4.0,cadquery-ocp==7.7.0,pedalboard==0.9.9,pyloudnorm==0.1.1,srt==3.5.3,xlrd==2.0.1。
A.7 选择职业的进一步方法细节
把职业分到行业。我们用 2023 年 BLS 全国就业矩阵(U.S. Bureau of Labor Statistics, 2025a),把每种职业分到就业人数最高的行业。做法是:筛到“细项”职业,取 NAICS(北美行业分类系统)代码的前两位,去掉“就业总数”行,加总 2023 年就业,把每种职业分到就业份额最大的行业。
关于 O*NET 数据来源。我们从 2024 年 5 月 OEWS 全国就业与工资统计中筛到“详细”职业,得到 831 种职业(U.S. Bureau of Labor Statistics, 2025b),以排除任何汇总就业类别。我们去掉“其他”职业,那是较宽组别里的兜底类别,把不属于该组任一详细职业的职业捆在一起。去掉之后剩下 761 种职业。
估计的工资总额:对有年薪的工作,为总就业乘以平均年薪;对只有时薪的工作,为总就业乘以时薪再乘以典型工作年 2,080 小时。哪些工作是年薪、哪些是时薪,包含在 O*NET 数据里。2,080 小时被劳工统计局称为“典型工作年”,假设每周工作 40 小时。这是不完美的估计(例如劳工统计局承认演员“一般并不全年每周工作 40 小时”),但是劳工统计局给出的最精确估计。
把职业分类为以数字工作为主,我们用基于任务的做法。对许多职业,ONET 数据库包含任务陈述和评分,列出该职业工人所做的全部任务。ONET 在任务数据里区分核心任务和补充任务,我们在计算任务份额时对两类一视同仁。ONET 数据在 6 位 SOC 职业代码(SOC-6)上提供。SOC 是标准职业分类。我们把 ONET 的 SOC-6 职业及相应任务,映射到 OEWS 数据集中按 4 位 SOC(SOC-4)报告工资的职业。对每个 SOC-4 职业,用一个得到职业和任务的 GPT-4o 提示,把任务分成数字或非数字。然后计算每种职业的数字任务加权份额。数字份额超过阈值 0.60 的职业被标为数字职业。
权重来自 ONET 调查的任务评分,包括每条任务的相关性、频率和重要性。两种没有 ONET 28.3 任务评分的职业(“设施经理”和“医学剂量师”)使用 O*NET 29.0 的任务评分。我们先为每个 6 位 SOC 职业与任务的组合计算调整后任务分。该分数是三项归一化任务评分的简单平均:任务频率、任务重要性和任务相关性。每项评分相对观察到的最大评分归一化(例如重要性满分是 5)。频率最大值为 7,重要性最大值为 5,相关性最大值为 100。若某条任务缺一项评分,用同一职业内全部任务该项评分的均值填补。例如某任务没有频率评分,就赋给它该职业全部任务的平均归一化频率。
然后把这些 6 位调整后任务分汇总成 4 位调整后任务分(对每一组 4 位 SOC 职业和任务)。做法是:对每个任务,把一个 SOC-4 职业内部各 SOC-6 职业的调整后任务分相加。若一个 SOC-4 只映射到一个 SOC-6,则两者的调整后任务分相同。例如 SOC-4 职业“计算机职业,其他”合并两个 6 位 SOC 职业(信息安全工程师和渗透测试员),它们有一条共同任务:“用渗透测试识别安全系统弱点。”这条任务有两个 SOC-6 调整后任务分,相加得到 SOC-4 调整后任务分。
接下来,为每个 4 位 SOC 职业与任务的组合计算加权任务份额。加权任务份额是该职业–任务对的调整后任务分,除以该职业全部调整后任务分之和。对每种职业,全部任务的加权任务份额之和为 1。加权任务份额衡量每条任务对该职业的相对重要性。这些份额就是计算每种职业数字任务加权份额时所用的权重。
缺失的任务陈述。OEWS 中一些职业没有配套的任务陈述或评分。其中 47 个是宽泛的“其他”类别,没有组成任务。另外 12 个在 ONET 29.0(截至 2025 年 8 月)被拆成更细的子职业。对后者,我们纳入其在 ONET 29.0 中子职业的全部组成任务。这 12 种职业的对应关系如下:
旅游与旅行导游:该 SOC 代码拆成旅游导游与陪同,以及“旅行导游”。我们加入两种职业的任务。
其他建筑及相关工人:拆成“分段铺路工”“保温安装工和技术员”以及“建筑及相关工人,其他”。我们加入前两者的全部任务。“建筑及相关工人,其他”是没有组成任务的一般类别。
教学助理:拆成学前、小学、初中和高中(特殊教育除外)教学助理,特殊教育教学助理,以及其他教学助理。我们加入前两者的任务。其他教学助理没有组成任务。
采购员与采购代理:拆成农产品采购员与采购代理,批发与零售采购员(农产品除外),以及采购代理(批发、零售和农产品除外)。我们加入三种职业的任务。
物质滥用、行为障碍与心理健康咨询师:拆成物质滥用与行为障碍咨询师,以及心理健康咨询师。我们加入两者的任务。
临床实验室技术专家与技术员:拆成医学与临床实验室技术专家、细胞遗传技术专家、细胞技术专家、组织技术专家、医学与临床实验室技术员,以及组织学技术员。我们加入全部这些职业的任务。
幼儿园和小学特殊教育教师:拆成幼儿园特殊教育教师和小学特殊教育教师。我们加入两者的任务。
家庭健康与个人照护助理:拆成家庭健康助理和个人照护助理。我们加入两者的任务。
房地产估价师与评估师:拆成房地产估价师与评估师,以及个人与商业财产估价师。我们加入两者的任务。
其他装配工与制造工:拆成其他装配工与制造工,以及团队装配工。我们匹配到团队装配工,因为“其他”是没有组成任务的一般类别。
电气、电子和机电装配工(线圈绕线工、胶带工和精加工工除外):拆成电气与电子设备装配工,以及机电设备装配工。我们加入两者的任务。
运输与物料搬运工人的一线主管(航空货物处理主管除外):拆成手工助手、劳工和物料搬运工的一线主管,物料搬运机械与车辆操作工的一线主管,旅客服务员的一线主管,以及其他运输工人的一线主管。我们加入前三者的任务。最后一项没有组成任务。
缺失的任务评分。有 36 个 SOC-6 职业在 ONET 28.3 或 29.0 中没有任何任务评分,对应 34 个 SOC-4 职业。其中 2 个 SOC-4 职业(数据科学家,以及网页与数字界面设计师)的部分组成 SOC-6 职业有任务评分,因而可以计算调整后任务分和加权任务份额。其余 32 个没有 ONET 任务评分的 SOC-4 职业,无法计算这两项。我们改用如下代理:对每个 4 位 SOC 职业与任务的组合,计算该任务在该职业中出现的次数(任务频率),再除以该职业全部任务的频率之和。例如 4 位 SOC 职业“幼儿园和小学特殊教育教师”合并两个 6 位职业,有 43 条互不重复的任务,其中 17 条出现两次,43 条任务的频率之和为 60。出现一次的任务,代理加权任务份额为 1/60 = 0.0017;出现两次的为 2/60 = 0.0033。
#### A.7.1 校验数字任务度量
我们把“知识工作”分类方法,对照 Acemoglu & Autor (2011) 的任务内容框架做基准。
该框架基于美国劳工部的 O*NET 调查。调查收集每种职业所需的活动、工作“内容”和能力。框架把这些度量汇总成五个分数:
非常规认知:分析性。
非常规认知:人际。
常规认知。
常规手工。
非常规手工体力。
每个分数是若干 O*NET“重要性”量表的合成。例如,每种职业的“非常规认知:分析性”分数,是把“分析数据/信息”工作活动、“创造性思考”工作活动,以及“为他人解释信息”工作活动的(归一化)值相加。某个分数的数值高,表示该职业严重依赖那一类工作。
我们为每种职业计算 Acemoglu & Autor (2011) 分数,再与我们的知识工作度量比较,也就是数字任务份额,以及每种职业的二元“知识工作”指标。
第一组结果:把每个 Acemoglu & Autor (2011) 任务内容分数与职业中的数字任务份额比较。模式清楚:数字任务份额更高的职业,在非常规认知维度上系统性地更高,在手工维度上更低。也就是说,一个职业越依赖数字任务,它就越像认知性的、非常规的工作。
图 17:职业与任务内容的分布。
第二组结果:看 Acemoglu & Autor (2011) 分数与我们的二元“知识工作”度量之间的关系。图中画出每种职业在每个分数上的值,并按本文的知识工作分类着色:被标为知识工作的职业为蓝色,其余为红色。模式同样清楚:知识工作职业聚集在非常规认知分布的顶部,以及常规和手工分布的底部。合在一起,这些结果说明我们的数字任务分类与关于认知/手工工作的经济文献紧密对齐。
图 18:数字任务与任务内容的散点图。
出处:Tejal Patwardhan, Rachel Dias, Elizabeth Proehl, Grace Kim, Michele Wang, Olivia Watkins, Simón Posada Fishman, Marwan Aljubeh, Phoebe Thacker, Laurance Fauconnet, Natalie S. Kim, Patrick Chao, Samuel Miserendino, Gildas Chabot, David Li, Michael Sharman, Alexandra Barr, Amelia Glaese, Jerry Tworek,GDPval: Evaluating AI Model Performance on Real-World Economically Valuable Tasks,2025-10-05,https://arxiv.org/abs/2510.04374,CC BY 4.0。
觉得有用,转给同事
微信扫码
用微信扫一扫,在手机上打开后即可转发。