CodexQA

行业与实践研究与基准测试

Agent 的毕业考·附录卷(上):ALE 构建细节与任务卡片

CodexQA 团队阅读约 27 分钟

《Agents' Last Exam》参考文献与附录 A–B 完整中译:SOC/O*NET 分类法推导、制造与工业运营/生物分子结构与设计/3D 动画与交互媒体/机器人与自主系统等六大行业版图综述、五道关卡任务构建流水线,以及制造 G-code、音频转写、色键合成、游戏骨骼动画、放射影像五个代表性任务卡片。

本文目录

Agents' Last Exam:附录卷(上)

译注:本卷为《Agent 的毕业考:ALE 用 1490 个真实行业任务度量经济价值工作》(https://openqa.cn/articles/agents-last-exam-economically-valuable-zh)的参考文献与附录 A–B 完整中译,含作者与单位、SOC/O*NET 分类法推导、行业版图综述、任务构建流水线与代表性任务卡片。评测流水线细节与扩展实验结果见《附录卷(下)》:https://openqa.cn/articles/agents-last-exam-appendix-2-zh

参考文献

  • [1] Pranjal Aggarwal, Graham Neubig, and Sean Welleck. Gym-anything: Turn any software into an agent environment, 2026.
  • [2] Alibaba Cloud. Alibaba unveils qwen3.6-plus to accelerate agentic ai deployment for enterprises and alibaba's ai applications. https://www.alibabacloud.com/en/press-room/alibaba-unveils-qwen3-6-plus-to-accelerate-agentic, 2026. Accessed: 2026-05-05.
  • [3] AlphaEval Team. Alphaeval: Real-world agent benchmark. https://alphaeval.ai/, 2026. Accessed: 2026-04-09.
  • [4] Anthropic. Claude code: An agentic coding tool. https://docs.anthropic.com/en/docs/claude-code, 2025. Accessed: 2026-04-09.
  • [5] Anthropic. Claude fable 5 and claude mythos 5. https://www.anthropic.com/news/claude-fable-5-mythos-5, 2026a. Accessed: 2026-06-11.
  • [6] Anthropic. Claude opus 4.6 system card. https://www-cdn.anthropic.com/14e4fb01875d2a69f646fa5e574dea2b1c0ff7b5.pdf, 2026b. Accessed: 2026-05-07.
  • [7] Anthropic. Introducing claude opus 4.7. https://www.anthropic.com/news/claude-opus-4-7, 2026c. Accessed: 2026-05-05.
  • [8] Anthropic. Introducing claude opus 4.8. https://www.anthropic.com/news/claude-opus-4-8, 2026d. Accessed: 2026-06-11.
  • [9] Anthropic. Claude sonnet 4.6. https://www.anthropic.com/claude/sonnet, 2026e. Accessed: 2026-05-05.
  • [10] Cursor. Cursor cli. https://cursor.com/en-US/cli, 2025. Accessed: 2026-05-05.
  • [11] Cursor. Introducing composer 2.5. https://cursor.com/blog/composer-2-5, 2026. Accessed: 2026-06-11.
  • [12] DeepSeek. Models & pricing. https://api-docs.deepseek.com/quick_start/pricing, 2026. Accessed: 2026-05-05.
  • [13] Jia Deng, Wei Dong, Richard Socher, Li-Jia Li, Kai Li, and Li Fei-Fei. Imagenet: A large-scale hierarchical image database. In _2009 IEEE Conference on Computer Vision and Pattern Recognition_, pages 248–255. IEEE, 2009.
  • [14] Docker. Droid. https://docs.docker.com/ai/sandboxes/agents/droid/, 2026. Accessed: 2026-05-05.
  • [15] Google. Gemini cli. https://google-gemini.github.io/gemini-cli/, 2025a. Accessed: 2026-05-05.
  • [16] Google. Gemini wins international collegiate programming contest gold. https://blog.google/technology/google-deepmind/gemini-gold-icpc/, 2025b. Accessed: 2026-04-09.
  • [17] Google. Gemini 3.1 pro: A smarter model for your most complex tasks. https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-1-pro/, 2026. Accessed: 2026-05-05.
  • [18] Google DeepMind. Advanced version of gemini with deep think officially achieves gold-medal standard at the international mathematical olympiad. https://deepmind.google/discover/blog/advanced-version-of-gemini-with-deep-think-officially-achieves-gold-medal-standard-at-the-international-mathematical-olympiad/, 2025. Published 2025-07-21.
  • [19] Yu Guo, Ryan Wen Liu, Jingxiang Qu, Yuxu Lu, Fenghua Zhu, and Yisheng Lv. Asynchronous trajectory matching-based multimodal maritime data fusion for vessel traffic surveillance in inland waterways. _IEEE Transactions on Intelligent Transportation Systems_, 24(11):12779–12792, 2023. doi: 10.1109/TITS.2023.3285415.
  • [20] Dan Hendrycks, Collin Burns, Steven Basart, Andy Zou, Mantas Mazeika, Dawn Song, and Jacob Steinhardt. Measuring massive multitask language understanding. _Proceedings of the International Conference on Learning Representations (ICLR)_, 2021.
  • [21] Carlos E. Jimenez, John Yang, Alexander Wettig, Shunyu Yao, Kexin Pei, Ofir Press, and Karthik R. Narasimhan. Swe-bench: Can language models resolve real-world github issues? In _The Twelfth International Conference on Learning Representations, ICLR 2024, Vienna, Austria, May 7-11, 2024_. OpenReview.net, 2024.
  • [22] Kilo AI. PinchBench: An OpenClaw agent benchmark leaderboard. https://pinchbench.com/, 2026. Snapshot of 2026-04-13.
  • [23] Mantas Mazeika, Alice Gatti, Cristina Menghini, Udari Madhushani Sehwag, Shivam Singhal, Yury Orlovskiy, Steven Basart, Manasi Sharma, Denis Peskoff, Elaine Lau, Jaehyuk Lim, Lachlan Carroll, Alice Blair, Vinaya Sivakumar, Sumana Basu, et al. Remote labor index: Measuring ai automation of remote work, 2025.
  • [24] Mike A. Merrill, Alexander G. Shaw, Nicholas Carlini, Boxuan Li, Harsh Raj, Ivan Bercovich, Lin Shi, Jeong Yeon Shin, Thomas Walshe, E. Kelly Buchanan, Junhong Shen, Guanghao Ye, Haowei Lin, Jason Poulos, Maoyu Wang, Marianna Nezhurina, Jenia Jitsev, Di Lu, Orfeas Menis Mastromichalakis, Zhiwei Xu, Zizhao Chen, Yue Liu, Robert Zhang, Leon Liangyu Chen, Anurag Kashyap, Jan-Lucas Uslu, Jeffrey Li, Jianbo Wu, Minghao Yan, Song Bian, Vedang Sharma, Ke Sun, Steven Dillmann, Akshay Anand, Andrew Lanpouthakoun, Bardia Koopah, Changran Hu, Etash Guha, Gabriel H. S. Dreiman, Jiacheng Zhu, Karl Krauth, Li Zhong, Niklas Muennighoff, Robert Amanfu, Shangyin Tan, Shreyas Pimpalgaonkar, Tushar Aggarwal, Xiangning Lin, Xin Lan, Xuandong Zhao, Yiqing Liang, Yuanli Wang, Zilong Wang, Changzhi Zhou, David Heineman, Hange Liu, Harsh Trivedi, John Yang, Junhong Lin, Manish Shetty, Michael Yang, Nabil Omi, Negin Raoof, Shanda Li, Terry Yue Zhuo, Wuwei Lin, Yiwei Dai, Yuxin Wang, Wenhao Chai, Shang Zhou, Dariush Wahdany, Ziyu She, Jiaming Hu, Zhikang Dong, Yuxuan Zhu, Sasha Cui, Ahson Saiyed, Arinbjörn Kolbeinsson, Jesse Hu, Christopher Michael Rytting, Ryan Marten, Yixin Wang, Alex Dimakis, Andy Konwinski, and Ludwig Schmidt. Terminal-bench: Benchmarking agents on hard, realistic tasks in command line interfaces. In _The Fourteenth International Conference on Learning Representations, ICLR 2026_, 2026.
  • [25] Grégoire Mialon, Clémentine Fourrier, Thomas Wolf 0008, Yann LeCun, and Thomas Scialom. Gaia: a benchmark for general ai assistants. In _The Twelfth International Conference on Learning Representations, ICLR 2024, Vienna, Austria, May 7-11, 2024_. OpenReview.net, 2024.
  • [26] MiMo-V2.5. Mimo-v2.5. https://huggingface.co/collections/XiaomiMiMo/mimo-v25, 2026.
  • [27] MiniMax. Minimax-m2.7. https://huggingface.co/MiniMaxAI/MiniMax-M2.7, 2026. Accessed: 2026-05-05.
  • [28] Moonshot AI. Model list. https://platform.kimi.ai/docs/models, 2026. Accessed: 2026-05-05.
  • [29] National Center for ONET Development. ONET 30.2 Database, 2026. URL https://www.onetcenter.org/database.html. Sponsored by the U.S. Department of Labor, Employment and Training Administration.
  • [30] National Institutes of Health. Nih-wide strategic plan for fiscal years 2021–2025. Technical report, National Institutes of Health, 2021. URL https://www.nih.gov/about-nih/nih-wide-strategic-plan.
  • [31] National Science Board, National Science Foundation. Science and engineering indicators 2024: The state of u.s. science and engineering. Technical Report NSB-2024-3, National Science Foundation, Alexandria, VA, 2024. URL https://ncses.nsf.gov/pubs/nsb20243.
  • [32] Nous Research. Hermes agent cli. https://hermes-agent.ai/tools/hermes-agent-cli, 2026. Accessed: 2026-05-05.
  • [33] OpenAI. Codex: A cloud-based software engineering agent. https://openai.com/index/introducing-codex/, 2025. Accessed: 2026-04-09.
  • [34] OpenAI. Introducing gpt-5.4. https://openai.com/index/introducing-gpt-5-4/, 2026a. Accessed: 2026-05-07.
  • [35] OpenAI. Introducing gpt-5.5. https://openai.com/index/introducing-gpt-5-5/, 2026b. Accessed: 2026-05-07.
  • [36] OpenClaw. Agent runtime. https://docs.openclaw.ai/agent, 2026. Accessed: 2026-05-05.
  • [37] Tejal Patwardhan, Rachel Dias, Elizabeth Proehl, Grace Kim, Michele Wang, Olivia Watkins, Simón Posada Fishman, Marwan Aljubeh, Phoebe Thacker, Laurance Fauconnet, Natalie S. Kim, Patrick Chao, Samuel Miserendino, Gildas Chabot, David Li, Michael Sharman, Alexandra Barr, Amelia Glaese, and Jerry Tworek. Gdpval: Evaluating ai model performance on real-world economically valuable tasks, 2025.
  • [38] N. G. Peterson, M. D. Mumford, W. C. Borman, P. R. Jeanneret, et al. Understanding work using the occupational information network (o*net): Implications for practice and research. _Personnel Psychology_, 54(2):451–492, 2001. doi: 10.1111/j.1744-6570.2001.tb00100.x.
  • [39] Long Phan, Alice Gatti, Nathaniel Li, Adam Khoja, Ryan Kim, Richard Ren, Jason Hausenloy, Oliver Zhang, Mantas Mazeika, Dan Hendrycks, Ziwen Han, Josephina Hu, Hugh Zhang, Chen Bo Calvin Zhang, Mohamed Shaaban, et al. A benchmark of expert-level academic questions to assess ai capabilities. _Nature_, 649(8099):1139–1146, January 2026. doi: 10.1038/s41586-025-09962-4.
  • [40] Dilip K. Prasad, Deepu Rajan, Lily Rachmawati, Eshan Rajabally, and Chai Quek. Video processing from electro-optical sensors for object detection and tracking in a maritime environment: A survey. _IEEE Transactions on Intelligent Transportation Systems_, 18(8):1993–2016, 2017. doi: 10.1109/TITS.2016.2634580.
  • [41] Qwen Team. Qwen3.7: The agent frontier. https://qwen.ai/blog?id=qwen3.7, 2026. Accessed: 2026-06-11.
  • [42] David Rein, Betty Li Hou, Asa Cooper Stickland, Jackson Petty, Richard Yuanzhe Pang, Julien Dirani, Julian Michael, and Samuel R. Bowman. Gpqa: A graduate-level google-proof q&a benchmark, 2023.
  • [43] David Silver, Aja Huang, Chris J. Maddison, Arthur Guez, Laurent Sifre, George van den Driessche, Julian Schrittwieser, Ioannis Antonoglou, Veda Panneershelvam, Marc Lanctot, et al. Mastering the game of go with deep neural networks and tree search. _Nature_, 529(7587):484–489, 2016. doi: 10.1038/nature16961.
  • [44] Elham Tabassi. Artificial intelligence risk management framework (ai rmf 1.0). Technical Report NIST AI 100-1, National Institute of Standards and Technology, Gaithersburg, MD, 2023.
  • [45] Tailcall. ForgeCode: Ai enabled pair programmer for claude, gpt, o series, grok, deepseek, gemini and 300+ models. https://github.com/tailcallhq/forgecode, 2024. Accessed: 2026-04-30.
  • [46] U.S. Bureau of Labor Statistics. 2018 standard occupational classification definitions, 2018.
  • [47] U.S. Congress. Chips and science act of 2022, public law 117-167, 2022. URL https://www.congress.gov/117/plaws/publ167/PLAW-117publ167.pdf.
  • [48] U.S. National Science Foundation. Chips and science, 2024. URL https://www.nsf.gov/chips.
  • [49] Xingyao Wang, Boxuan Li, Yufan Song, Frank F. Xu, Xiangru Tang, Mingchen Zhuge, Jiayi Pan, Yueqi Song, Bowen Li, Jaskirat Singh, et al. Openhands: An open platform for AI software developers as generalist agents. In _The Thirteenth International Conference on Learning Representations_, 2025.
  • [50] xAI. Models and pricing. https://docs.x.ai/developers/models, 2026. Accessed: 2026-05-05.
  • [51] Tianbao Xie, Danyang Zhang, Jixuan Chen, Xiaochuan Li, Siheng Zhao, Ruisheng Cao, Toh Jing Hua, Zhoujun Cheng, Dongchan Shin, Fangyu Lei, Yitao Liu, Yiheng Xu, Shuyan Zhou, Silvio Savarese, Caiming Xiong, Victor Zhong, and Tao Yu. Osworld: Benchmarking multimodal agents for open-ended tasks in real computer environments. In Amir Globersons, Lester Mackey, Danielle Belgrave, Angela Fan, Ulrich Paquet, Jakub M. Tomczak, and Cheng Zhang, editors, _Advances in Neural Information Processing Systems 38: Annual Conference on Neural Information Processing Systems 2024, NeurIPS 2024, Vancouver, BC, Canada, December 10 - 15, 2024_, 2024.
  • [52] John Yang, Carlos E Jimenez, Alexander Wettig, Kilian Lieret, Shunyu Yao, Karthik Narasimhan, and Ofir Press. Swe-agent: Agent-computer interfaces enable automated software engineering. _Advances in Neural Information Processing Systems_, 37:50528–50652, 2024.
  • [53] Qianyu Yang, Yang Liu, Jiaqi Li, Jun Bai, Hao Chen, Kaiyuan Chen, Tiliang Duan, Jiayun Dong, Xiaobo Hu, Zixia Jia, Yang Liu, Tao Peng, Yixin Ren, Ran Tian, Zaiyuan Wang, Yanglihong Xiao, Gang Yao, Lingyue Yin, Ge Zhang, Chun Zhang, Jianpeng Jiao, Zilong Zheng, and Yuan Gong. $onemillion-bench: How far are language agents from human experts?, 2026. URL https://arxiv.org/abs/2603.07980.
  • [54] Shunyu Yao, Jeffrey Zhao, Dian Yu, Nan Du, Izhak Shafran, Karthik R. Narasimhan, and Yuan Cao. React: Synergizing reasoning and acting in language models. In _The Eleventh International Conference on Learning Representations, ICLR 2023, Kigali, Rwanda, May 1-5, 2023_. OpenReview.net, 2023.
  • [55] Z.AI. Glm-5.1. https://docs.z.ai/guides/llm/glm-5.1, 2026. Accessed: 2026-05-05.
  • [56] Shuyan Zhou, Frank F. Xu, Hao Zhu, Xuhui Zhou, Robert Lo, Abishek Sridhar, Xianyi Cheng, Tianyue Ou, Yonatan Bisk, Daniel Fried, Uri Alon, and Graham Neubig. Webarena: A realistic web environment for building autonomous agents. In _The Twelfth International Conference on Learning Representations, ICLR 2024, Vienna, Austria, May 7-11, 2024_. OpenReview.net, 2024.

附录 A 作者

下文每位贡献者均列出其完整单位(上标编号),与本节末尾的编号机构列表一一对应。

A.1 贡献者与单位

执行团队。 Yiyou Sun1, Xinyang Han1, Weichen Zhang1, Yuanbo Pang1, Tianyu Wang2, Yuhan Cao1, Yixiao Huang1, Chris Duroiu1, Haoyun Zhang1, Jeffrey Lin1, Weishu Zhang1, Tyler Zeng1, Ying Yan2, Bo Liu3, Hanson Wen1, Mingyang Xu4, Xiaoyuan Liu1, Zimeng Chen1, Weiyan Shi5, Amanda Dsouza6, Vincent Sunn Chen6, Dawn Song1

顾问委员会。 Patrick Bryant7, Carl Boettiger1, Yamini Rangan8, Bradley Rothenberg9, Kyle Steinfeld1, Arvind Rao4, Tapio Schneider10, Georgios Yannakakis11, Laure Zanna12, Kaan Ozbay12, Ida Sim13, Tarek Zohdi1, George Em Karniadakis14, Jack Gallant1, Teresa Head-Gordon1

数据贡献者。 Yushan Li1, Wenxi Deng1, Tao Sun1, Huiqi Wang1, Zhun Wang1, Justin Xu15, Chris Yuhao Liu16, Yafei Cheng2, Rongwang Hu2, Aras Bacho10, Shengcao Cao17, Zengyi Qin18, Yixiong Chen19, Hengduan Fan2, Hao Liu3, Lin Zeng2, Shashank Muralidhar Bharadwaj20, Litian Gong21, Yingxuan Yang1, Maojia Song22, Ruheng Wang23, Zongzheng Zhang2, Honglin Bao84, Shuo Lu2, Jianhong Tu16, Zhonghua Wang24, Zheng Zhang25, Zijiao Chen3, Yanqiong Jiang26, Zhendong Li27, Bohan Lyu1, Chang Ma28, Peiran Xu30, Benran Zhang26, Shangding Gu1, Haoyue Hua2, Haoyang Li32, Wanzhe Liao2, Chengzhi Liu33, Junbo Peng34, Haoran Sun38, Zechen Xu35, Bo Chen2, Jiayi Cheng12, Yi Jiang23, Keying Kuang1, Yuan Li31, Youbang Pan2, Ziyan Rao36, Alexander Schubert13, Yifan Shen37, Vincent Siu16, Xiatao Sun38, Kangqi Zhang4, Xiaopan Zhang21, Yuchen Zhu29, Ishaan Singh Chandok40, Lei Ding16, Jingxuan Fan40, Andrew Glover28, Jiaming Hu41, Yiran Hu1,60, Wenbo Huang17, Zixin Jiang35, Haoran Jin4, Lukas Kim1, Ming Liu42, Yang Liu87, Alireza Rafiei34, Xuhuan Shen1, Kunyang Sun1, Sophia Sun43, Ting Sun2, Eric Wang1, Yixin Wang3, Hanwen Xing43, Sihan Xu4, Yuzheng Xu44,88, Zhongxing Xu24, Zhiling Yan27, Boqin Yuan32, Ruiqi Zhang1, Yifan Zhang17, Zibo Zhao45, Liana2, Santanu Bosu Antu38, Haoyue Bai20, Carlo Bosio1, Joseph Cavanagh1, Patricia Cavazos-Rehg46, Tianxing Chen2, Xuewen Chen2, Yipu Chen29, Chenyu Zhu2, Chen Dai3, Stefano De Castro1, Yunfu Deng20, Kaustubh Dhole34, Jiayuan Ding47, Chenchen Du48, Zhehang Du31, Hao Fan46, Run-Ze Fan49, Hengyu Fu1, Shi Gu50, Yifan Gu2, Charlie Guo51, Baihe Huang1, Baixiang Huang34, Rimika Jaiswal33, Zhihan Jiang39, Ran Jin52, Erin Kasson46, Xin Lan53, Joseph Lee28, Deren Lei54, Chenyu Li55, Daofeng Li46, Haitao Li2, Hongwei Li33, Jingyan Li2, Xiao Li46, Yi Li1, Yinsheng Li56, Yuangang Li57, Zhixu Li21, Wenyu Liang2, Longtai Liao58, Kevin Qinghong Lin15, Andy Zeyi Liu38, Che Liu85, Jiaming Liu37, Kaiyuan Liu28, Xuan Liu32, Pan Lu3, Wenbo Lv2, Yicheng Lyu2, Qiuyang Mang1, Kyle Montgomery16, Yuzhou Nie33, Ruoxi Ning60, Jorin Overwiening40, Xu Pan40, Layna Paraboschi46, Core Francisco Park40, Justin Purnomo1, Swati Rajwal34, Scott Rankin1, Bixuan Ren35, Yiren Rong1, HaoYang Shang61, Ventus Shaw2, Fiona Shen38, Jiawei Shen46, Minqi Shi2, Shi Qiu62, Tianneng Shi1, Jonah So33, Vladislav Susoy40, Hannah Szlyk46, Haocheng Wang1, Jialu Wang16, Wei Wang31, Xinyu Wang20, Zehao Wang21, Dowling Wong86, Angela Wu1, Dehao Wu17, Fangyu Wu39, Mengyuan “Millie” Wu39, Yu Wu64, Yuchen Wu28, Yuhao Wu46, Qingpo Wuwu2, Weihang Xiao43, Yongyi Xiong65, Fan Xu1, Ruiling Xu17, Mingxuan Yan21, Benjamin Yang28, Jirong Yang4, Sen Yang38, Xiaoli Yang3, Yushi Yang15, Haoran Ye2, Xiaohu Yu66, Zhengming Yu50, Chenlong Zhang33, Chi Zhang2, Hanning Zhang33, Hanwen Zhang40, Junge Zhang21, Kunpeng Zhang28, Song Zhang2, Wenjin Zhang46, Wenshuo Zhang2, Ying Zhang2, Yizhi Zhang67, Brian Zhao68, Qijian Zhao2, Yimin Zhao28, Yuhaohua Zheng5, Liwei Zhou19, Tianyue Zhou1, Sichen Zhu29, Siqi Zhu17, Yan Zhu1, Yishu Zhu1, Jierui Zuo28, Chonghao Cai69, Helena Casademunt40, Wenjia Chen70, Cheng Cheng4, Nawen Deng72, Rao Fu14, Tianfu Fu37, Yifan Han2, He Ren74, Zhenyu He1, Qiao Jin75, Langlang Li1, Yuetai Li28, Sylvia Liu2, Lu Lu1, Luqing Zhou76, Subhabrata Mukherjee47, Yunqi Ouyang2, Yin Ren40, Dawei Shi77, Haoran Wu78, Zhiyue Wu2, Hannah Yao79, Zhuoran Yi80, Jenny Yu70, Rhea Zhan1, Hang Zhou81, Blake Zhu77, Junfan Zhu2, Alan Yuille19, Yang Liu16, Russell Alan Poldrack3, Jiachen Li21, Zhenglu Li26, Molei Tao29, Jing Huang31, Wenqi Shi23, Costas Spanos1, Lichao Sun27, Chenguang Wang16, Orson Xu39, Zhen Dong33, Hector Gomez82, Aylin Caliskan28, Ali Emami34, Haimin Hu19, Zhi Li83, Lihui Liu59, Murphy Niu33, Yi Shao56, Jianxin Sun63, Mikko Tolonen64, Ting Wang46, Sanjiv Das71, Yanjun Gao73, Wenbo Guo33, Erika J Schneider35, Zhiyong Lu75, Yian Ma32, Mark Mueller1, Radha Poovendran28, Somayeh Sojoudi1, Huaxiu Yao62, Yinglun Zhu21

单位列表

  1. University of California, Berkeley
  1. Independent Contributor
  1. Stanford University
  1. University of Michigan
  1. Northeastern University
  1. Snorkel AI
  1. SciLifeLab
  1. HubSpot
  1. nTop
  1. California Institute of Technology
  1. University of Malta
  1. New York University
  1. University of California, San Francisco
  1. Brown University
  1. University of Oxford
  1. University of California, Santa Cruz
  1. University of Illinois Urbana-Champaign
  1. OpenAGI Research Foundation
  1. Johns Hopkins University
  1. University of Wisconsin-Madison
  1. University of California, Riverside
  1. Singapore University of Technology and Design
  1. University of Texas Southwestern Medical Center
  1. Monash University
  1. Adobe
  1. University of Southern California
  1. Lehigh University
  1. University of Washington
  1. Georgia Institute of Technology
  1. University of California, Los Angeles
  1. University of Pennsylvania
  1. University of California, San Diego
  1. University of California, Santa Barbara
  1. Emory University
  1. Syracuse University
  1. UMass Chan Medical School
  1. Massachusetts Institute of Technology
  1. Yale University
  1. Columbia University
  1. Harvard University
  1. Boston University
  1. Iowa State University
  1. Amazon
  1. University of Tokyo
  1. Arizona State University
  1. Washington University in St. Louis
  1. Hippocratic AI
  1. Aalto University
  1. University of Massachusetts Amherst
  1. Texas A&M University
  1. X School
  1. AstraZeneca
  1. Michigan State University
  1. Meta
  1. Cornell University
  1. McGill University
  1. University of California, Irvine
  1. Oracle
  1. Wayne State University
  1. University of Waterloo
  1. BreathingCORE Limited
  1. University of North Carolina at Chapel Hill
  1. University of Nebraska-Lincoln
  1. University of Helsinki
  1. Carnegie Mellon University
  1. University of Melbourne
  1. Jiji Information & Communication Technology Branch
  1. Mission San Jose High School
  1. ETH Zurich
  1. Morgan Stanley
  1. Santa Clara University
  1. Photon Fund
  1. University of Colorado Anschutz Medical Campus
  1. PIMCO
  1. U.S. National Institutes of Health
  1. Goldman Sachs
  1. Brix Labs
  1. Intellipro
  1. JPMorgan Chase
  1. University of Utah
  1. LeverArch.ai
  1. Purdue University
  1. University of Colorado Boulder
  1. University of Chicago
  1. Imperial College London
  1. Karlsruhe Institute of Technology
  1. North Carolina Central University
  1. NanoFrontier

附录 B 基准构建细节

B.1 分类法细节

#### B.1.1 分类法定义

范围。 ALE 评估通用计算机使用 agent 能否通过数字界面、软件工具、文件与 API 完成跨领域的有价值专业工作。该分类法聚焦于满足以下条件的工作流:其主要产出可在计算机上完成、依赖领域专业知识,且产生可客观评估的产物。

职业骨架。 我们使用 SOC 2018 作为职业骨架,并借助 ONET 通过关联的任务、工作活动与工具-技术记录来解读职业内容 [46, 38, 29]。SOC 2018 提供美国职业的标准分类,而 ONET 提供职业层面的记录,描述工作内容、活动、任务与技术使用。SOC 2018 以 23 个大类、98 个中类、459 个宽职业与 867 个细职业刻画了美国工作的结构。为推导 ALE 的工作流级分类法,我们在这些职业记录中筛选范围内的数字化工作流,把保留的职业证据整合为子领域,并在稳定的前沿工作流缺失或定义不足时对 SOC/O*NET 加以补充。

筛选流程。 初始筛选把范围定义应用于 ONET 30.2 Occupation Data 中的 1,016 个条目 [29],使用温度为 0 的固定 GPT-4o mini 提示词。每个提示词实例包含 SOC 代码与名称、ONET 描述、任务陈述、工作活动与技术示例。在把 O*NET 变体归并到共享的 SOC 基础代码之后,剩余 117 个唯一 SOC 基础代码。

子领域构建。 筛选阶段识别出职业层面的证据,我们随后将其组织为工作流层面的子领域。我们把任务陈述、工作活动与工具-技术记录描述同一类「产出产物的专业工作」的 SOC 代码归为一组。领域、方法论与工作产物是划定子领域边界的主要维度,并借助 LLM 辅助研究与领域专家评审来核查边界情形的归属。当一个 SOC 代码的工作内容包含可分离的工作流时,它可以被分配到多个子领域。这一过程产出 51 个 SOC 锚定子领域。

前沿扩展。 SOC/O*NET 把分类法锚定在既有职业上。ALE 进一步为新兴数字化工作流添加了前沿补充——这些工作流尚未体现在 SOC 2018 中,但已出现在当前研究与专业实践中,如近期 NIH、NSF 及领域专项技术路线图所反映的 [30, 31, 47, 48, 44]。该补充新增四个前沿子领域与七项对 SOC 锚定子领域的扩展,总计得到 55 个子领域。

结果。 最终分类法包含 55 个工作流级子领域,归入 13 个领域。

#### B.1.2 行业格局综述

采集语境。 子领域工作流格局为每个子领域内的任务工作流提供采集语境。每份格局综述总结一类专业工作流相关的工作场景、从业者角色、数字化输入、工作流依赖关系与输出产物。这些记录基于领域参考文献、工作流文档、LLM 辅助研究与专家评审。它们用于组织候选任务族,并核查所采集的任务是否规定了现实的输入、符合实践的交付物以及可验证的成功标准。本节收录四份示例性子领域工作流格局。

#### B.1.3 制造与工业运营

制造与工业运营(Manufacturing & Industrial Operations)涵盖把 CAD 几何、物料清单、工艺规范与生产目标转化为工艺路线、刀路、产线布局、控制逻辑与检验计划的工作流。一个反复出现的交接风险是数字化计划与物理工艺之间的一致性:控制器方言、夹具几何、报警优先级与公差累积需要在 CAM、控制、工业工程与质量评审之间全程跟踪。

工作始于零件模型、材料要求与生产目标。工艺规划师指定机床类别与工艺路线;CAM 编程师生成刀路、后处理 G 代码,并在毛坯仿真中验证刀具运动;工业工程师对照节拍时间平衡各工位工时;控制工程师编写 PLC 逻辑、SCADA 画面、报警优先级与安全联锁;质量工程师制定 SPC 计划、控制限与首件检验规程。所得产物包括工艺路线计划、后处理代码、仿真输出、控制文件、SPC 计划与检验文件包。当某个特征漂出规格时,可以把检验记录与工艺历史进行比较,必要时把工作流退回夹具、参数或刀路修订环节。

#### B.1.4 生物分子结构与设计

生物分子结构与设计(Biomolecular Structure & Design)涵盖湿实验执行之前的计算工作流。典型输入包括靶点假设、候选序列或配体、结构模板、实验约束与宿主生物要求。一个反复出现的交接风险是模型与生物材料之间的一致性:质子化状态、保留水分子、MSA 深度、密码子使用与组装接头保真度需要从计算设计一直跟踪到实验交接。

工作始于一个待抑制的蛋白、一个待设计的结合子或一条待表达的通路。计算化学家对候选配体做对接并运行分子动力学;结构生物学家向结构预测器查询相关构象;蛋白设计师用逆折叠与稳定性模型过滤序列;生物信息学家构建 MSA 并针对宿主做密码子优化;合成生物学家起草质粒图谱与组装接头。所得产物包括排序后的配体位姿、结构模型、序列设计、密码子优化构建体、质粒图谱与设计登记条目。如果结合子未能结合、预测位姿被证伪或通路滴度不达标,记录在案的假设有助于确定需要回溯的计算层。

#### B.1.5 3D、动画与交互媒体

3D、动画与交互媒体(3D, Animation & Interactive Media)涵盖把剧本、分镜、视觉风格简报与玩法需求转化为渲染帧或运行时状态的工作流。资产依次经过几何、绑定、材质、动画、灯光、合成与引擎阶段。一个反复出现的交接风险是:当创作资产在工具之间流转时,比例、坐标系、导入设置、色彩空间与时间元数据必须得到保留。

工作始于剧本、分镜与视觉风格简报。概念设计师确立视觉语言;建模师在比例、拓扑与多边形预算约束下构建几何;视觉开发(look-development)设计师创作材质与纹理;绑定师搭建骨架与变形器;动画师对照绑定与摄像机制作关键帧动作;灯光技术总监布置场景;特效师模拟粒子、流体与破碎;合成师分层渲染元素;运行时工程师与技术美术则把资产集成进玩法逻辑、着色器、命名规范与管线布局。所得产物包括模型、绑定、纹理集、材质图、动画片段、灯光设置、合成文件与引擎场景。当某个镜头或构建版本出现比例、颜色或时间错误时,资产图有助于定位引入漂移的环节。

#### B.1.6 机器人与自主系统

机器人与自主系统(Robotics & Autonomous Systems)涵盖把任务规格与环境模型转化为机器人描述、感知标定、控制器、规划器、安全逻辑与仿真资产的工作流。一个反复出现的交接风险是仿真到现实(sim-to-real)的差距:运动学描述、传感器变换、控制器增益、规划器参数与仿真器假设需要从数字孪生一直跟踪到硬件。

工作始于任务规格,例如拾取零件、到达目标位置或在受限路线中导航。机械工程师确定 URDF 与关节限位;感知工程师标定传感器、验证变换,并针对预期噪声测试感知;控制工程师调优增益并设计安全控制器;运动规划器与轨迹优化器在运动学与动力学约束下组合规划;行为工程师把状态机、行为树或学习到的策略与故障模式连接;仿真工程师维护数字孪生;安全工程师把系统映射到危害分析。所得产物包括 URDF、标定文件、控制器参数、规划器配置、行为规格、仿真场景与硬件在环测试记录。当硬件行为与仿真出现分歧时,记录在案的不一致可为仿真器、控制器或策略的更新提供依据,然后再让系统回到验证台。

软件生态星座图

图 10:ALE 任务覆盖的软件生态。每个图标是一个出现在至少一个任务工作流中的独立应用或工具链,按其所属的主要 ALE 领域定位。重叠区域放置跨多个领域的工具(例如视觉与媒体艺术和工程共享的创意套件应用)。该图为定性示意;逐子领域的定量实例数见图 2。

B.2 任务构建流水线细节

本附录展开第 2.3 节所总结、图 4 所描绘的分阶段构建协议。该协议通过五道关卡把专家提交的工作流转化为基准实例:专家征集、任务提交与编辑、初审、任务实现,以及最终质量控制与接收。

专家征集。 流水线始于定向的专家外联。为确保覆盖既定的分类法,我们组建了由行业领军人物与专家型从业者构成的顾问委员会。该委员会锚定了那些在日常实践中执行复杂软件工作流的领域专家的招募。

任务提交与编辑。 任务直接来源于这些从业者,通过专用网页提交门户(https://agents-last-exam.org/submit/new/form)。专家承担的结构性开销被刻意压低:他们只需上传自己过去曾耗时数天或数周完成的项目。门户上的 AI 辅助工具帮助从业者迭代打磨提案,直到核心组件被完整规定:自然语言描述、输入文件、目标软件与工具、预期输出交付物,以及清晰的评测规格。对于以来源为依据的任务,公开论文 [40, 19]、数据集、标准与工作流文档也可定义输入资产、标签集或参考产物;任务包保留这些来源记录,作为其素材出处的一部分。

初审。 提交后,任务经历第一轮评审,充当筛选关卡。提交会收到标准会议式决定的反馈:大修/小修、边界接收、接收、强接收。任何基于修订的决定都会把提案退回专家做进一步编辑。

任务实现。 提案任务随后必须从书面规格转译为可执行的基准环境。在实现阶段,工程团队把专家意图转化为可运行资产、配置必要的软件容器,并把评测逻辑固化为代码。这一过程包含严格的工程师评审与试运行执行。如果工程师发现任务逻辑存在缺口或缺少依赖,系统会触发自动邮件通知,把任务日志退回专家以解除开发阻塞。

最终质量控制与接收。 在完全实现的任务被纳入基准之前,它要通过由专家委员会监督的最终质量控制关卡。这一同行评审步骤同时评估可复现性与评测完整性。具体而言,评审人检查专家的参考输出是否根本上正确、评测边界是否恰当校准(例如既不过窄到不可能,也不失之过宽),以及问题语境是否提供了达到最终状态所需的全部信息。此阶段发现的问题会把任务退回,在接收前做最终调整。

B.3 行业任务卡片与元数据

#### B.3.1 代表性任务卡片

我们给出代表性任务卡片,以说明 ALE 任务实例如何被规定、执行与打分。每张卡片总结一个已执行任务实例的 agent 侧请求、输入材料、预期交付物、评分细则、观测得分与观测结果。这里展示的所有轨迹均由运行 Claude Opus 4.7 的 Claude Code harness 产生。这些卡片旨在把基准构建与评测协议在实例层面具体化,与正文报告的总体覆盖与性能结果互为补充。

任务卡片 1:注塑模流分析(PARTIAL,部分通过) 任务 ID:manufacturing/mold-flow

观测得分:0.476。制造。Moldex3D。CAE。

任务描述:注塑模流仿真支撑模具与工艺决策。任务提供一个已划分网格的 Moldex3D 项目、一份工艺规范与一个结果模板。agent 必须打开项目 230057,应用 process_spec.json,运行填充、保压、冷却与翘曲分析,并把求解器导出的压力、力、时间、体积与重量数值写入 output/results.json。

软件/执行视图:![[Uncaptioned image]](https://arxiv.org/html/2606.05405v2/figures/task-card-assets/gui-economic/manufacturing-mold-flow-execution.png) Moldex3D CAE 工作流:agent 正在为一个四腔注塑模仿真编辑保压压力曲线。这是工艺设置阶段;打分取决于完成求解器运行并把压力、力、循环时间、体积与重量指标提取到 results.json。

输入材料:• 已预置的 Moldex3D 项目,含网格、材料与四腔几何。• process_spec.json,规定填充、保压、冷却与翘曲工艺设置。• results_template.json,定义最终 JSON 所需的每一项指标。

参考输出:• 配置好的仿真运行之后保存的 Moldex3D 项目。• output/results.json,填入注射压力、V/P 切换压力、锁模力、冷却/循环时间、体积与重量字段。

评分细则:• 硬性门槛拒绝缺失、格式错误或全为 null 的 results.json。• 主评分把每个数值字段与隐藏的求解器参考值在 1% 相对容差内比较。• 生成的项目产物仅在主指标薄弱时提供有限的部分分。

观测结果:• 得分:0.4762。agent 找到了正确的 Moldex3D 设置工作流并提交了 results.json,但得分表明只获得部分数值/结果分。• 失败模式:提交的指标并非可靠地从已完成的求解器输出中提取;部分数值是估计值而非实测的 CAE 结果。• 解读:没有闭环数值验证,仅 GUI 设置成功是不够的:应等待结果文件、检查或导出求解器数据,然后填入 JSON。

任务卡片 2:管弦乐音乐转谱(FAIL,失败) 任务 ID:audio/music_transcription

观测得分:0.000。音频制作。记谱。Dorico。

任务描述:管弦乐转谱把一段音频录音转化为可打印乐谱与多轨 MIDI。任务提供一份音频简报、一个 Dorico 环境、指定曲目、速度、配器合同与确切的输出文件要求。agent 必须遵循 Dorico Prelude / Akinola / 速度 140 / 27 件乐器的规格,交付 transcription.pdf、transcription.mid 与 overview.png。

软件/执行视图:![[Uncaptioned image]](https://arxiv.org/html/2606.05405v2/figures/task-card-assets/gui-economic/audio-music-transcription-execution.png) 音乐雕版工作流:Dorico 以打印/导出模式打开一份管弦乐总谱。任务要求把音频简报转化为可读的完整总谱与 MIDI,然后把 PDF、MIDI 与总览截图导出到确切的输出路径。

输入材料:• 音频参考与 task_brief.json,含标题、作曲家、速度、乐器与 GM 音色程序。• 用于乐谱雕版与导出的 Dorico 环境。• PDF、MIDI 与总览截图的输出路径要求。

参考输出:• transcription.pdf,展示一份完整、可读的总谱。• transcription.mid,含多轨时序、音高、力度与 GM Program Change 分配。• overview.png,展示含所生成乐谱的记谱 UI。

评分细则:• PDF 缺失、MIDI 缺失或记谱截图缺失/无效会触发硬性零分。• 通过门槛后,音高与节奏各占 30%,力度占 20%,乐器分配占 10%,乐谱版面占 10%。• MIDI 在轨道配对与量化之后与参考 MIDI 比较。

观测结果:• 得分:0.0。agent 找到了匹配的 Dorico 项目并导出了 transcription.mid,但所需的 transcription.pdf 与 overview.png 未得到确认。• 失败模式:提交只包含所需文件包的一部分,而评分硬性门槛要求在评估音乐准确性之前先有完整的乐谱/MIDI/截图包。• 解读:部分工具使用未能转化为创作生产任务中可靠的多产物交付。

任务卡片 3:基于参考帧的色度键合成(FAIL,失败) 任务 ID:media/chroma_key_from_reference

观测得分:0.000。VFX。DaVinci Resolve。合成。

任务描述:色度键控是一项 VFX 精修任务:移除绿幕背景、保留前景边缘、把主体置于预期底板上,并匹配参考帧。任务提供一段鸟类前景素材、一张参考图像与一个 DaVinci Resolve 环境。agent 必须创建 Resolve 项目、从 input.mp4 中抠出鸟、匹配 input.png 所隐含的合成效果,并导出 output/output.mp4。

软件/执行视图:![[Uncaptioned image]](https://arxiv.org/html/2606.05405v2/figures/task-card-assets/gui-economic/media-chroma-key-execution.png) VFX 合成工作流:DaVinci Resolve 显示含鸟类素材的时间线与预览监视器。任务要求识别绿幕前景、抠像、把它合成到预期天空底板之上,并匹配参考帧。

输入材料:• input.mp4,用于抠像工作流的源素材。• input.png,定义目标合成与前景位置的参考帧。• DaVinci Resolve 桌面环境与所需输出路径。

参考输出:• output/output.mp4,包含合成后的鸟类镜头。• 帧内前景得到保留、绿幕被移除,轮廓/位置接近参考。

评分细则:• 远程评分从 reference/breakpoint.json 中采样帧。• 前景保留由 roi_input_cv 把关,质量使用全帧加 ROI 边缘 IoU。• 还需一个本地视觉评审确认做了真实的抠像相关编辑,而非原始素材拷贝。

观测结果:• 得分:0.0。agent 使用了 Resolve 并导出了 MP4,但输出未满足基于参考帧的色度键变换。• 失败模式:提交把一个貌似合理的「鸟在天空上」片段当作目标,而没有保留参考材料中预期的前景/背景关系。• 解读:错误在于视觉任务对齐,而非仅仅是软件操作。

任务卡片 4:骨骼动画复现(PARTIAL,部分通过) 任务 ID:game/skeletal_animation_reproduction

观测得分:0.429。游戏/3D。Blender。动作匹配。

任务描述:动画制作把一个静态角色资产变成带绑定、可重放的性能演出。任务提供一个 Blender 环境、Singing.obj 与一段参考动作视频。agent 必须为角色绑定骨骼、复现 reference.mp4 中的身体动作、包含 19 个确切的骨骼名称,并同时提交可编辑的 final.blend 与可重放的 preview.mp4。

软件/执行视图:![[Uncaptioned image]](https://arxiv.org/html/2606.05405v2/figures/task-card-assets/gui-economic/game-skeletal-animation-output.png) 3D 动画输出视图:此渲染帧展示了来自 agent Blender 提交的带绑定歌手角色。任务是复现参考视频中的身体动作,因此单个看似有效的帧只是部分证据;时序、姿态范围与重放一致性决定成败。

输入材料:• Singing.obj 静态角色网格。• reference.mp4 身体动作目标与 reference/package.json 骨骼名称要求。• Blender 运行时,用于绑定、打关键帧、渲染与重放验证。

参考输出:• final.blend,包含带所需骨骼名称的可用动画绑定。• preview.mp4,其身体动作、时序与姿态范围匹配隐藏的干净参考。

评分细则:• 有效性门槛要求两份产物齐备且动画绑定非平凡。• 评分结合视频匹配、从 final.blend 重放的一致性、最小骨骼覆盖与二元视觉检查。• 即便所需文件存在,动作过短或被衰减也会失分。

观测结果:• 得分:0.4285。所需的 Blender 与预览产物存在且包含动画,因此该次运行获得部分分。• 失败模式:preview.mp4 约 4 秒,而参考约 13.6 秒,且动作被衰减以减少网格畸变。• 解读:提交满足了文件层面的有效性,但未满足完整的动作保真要求。

任务卡片 5:MicroDicom 胸部 X 光裁定(PARTIAL,部分通过) 任务 ID:radiology/microdicom_nih_cxr_reader_adjudication

观测得分:0.333。放射科。DICOM GUI。标注 QA。

任务描述:放射科数据集策管常常需要在相互竞争的阅片者标注之间做裁定。任务提供九个 NIH CXR DICOM 病例、每例两个候选肺不张框、阅片者笔记与固定的 TSV 模式。agent 必须在 MicroDicom 中逐例检查、选出更好的阅片者标注,并提交 adjudicated_boxes.tsv、adjudication_log.tsv 与 final_impressions.tsv。

软件/执行视图:![[Uncaptioned image]](https://arxiv.org/html/2606.05405v2/figures/task-card-assets/gui-economic/radiology-microdicom-execution.png) 放射科裁定工作流:MicroDicom 显示一张带 DICOM 元数据与标注工具的胸部 X 光片。任务要求逐例复审、比较两个阅片者的肺不张框并写出 TSV 决定;交付物依赖对每个病例的视觉裁定。

输入材料:• 九个 DICOM 胸部 X 光病例及病例清单。• reader_a 与 reader_b 的标注 TSV 及临床笔记。• 固定标签、允许的 selected_reader 取值与输出模式的规则。

参考输出:• adjudicated_boxes.tsv,含每例最终的阅片者选择与框。• adjudication_log.tsv 与 final_impressions.tsv,含所需行与固定标签。

评分细则:• 每份 TSV 对缺失文件、表头格式错误、无效阅片者取值或固定标签错误都设有硬性门槛。• 日志与印象文件必须按 case_id 与隐藏参考完全一致。• 框输出必须选中隐藏支持的阅片者,且与金标准框的 IoU 至少 0.50。

观测结果:• 得分:0.3333。agent 写出了覆盖全部九个病例的三份所需 TSV 文件,但得分表明与隐藏参考仅部分一致。• 失败模式:详细的影像复审只出现在少数病例;后续决定依赖坐标与启发式,而非系统性的视觉裁定。• 解读:文件格式合规强于逐病例的视觉领域判断。

#### B.3.2 已执行任务清单

150 个入选公开任务的完整清单(含任务名称、任务标识符、领域与每项的简要描述)可在 https://agenthle.org/demo 的 _Benchmark Splits (ALE-V1, 2026/06)_ 标签页下在线浏览。

觉得有用,转给同事

微信扫码

用微信扫一扫,在手机上打开后即可转发。

用 RSS 订阅

提交勘误