在 实践 中 度量 人工 智能 智能 体 的 自主 性
Anthropic 用 Claude Code 和公开 API 的真实交互度量智能体自主性。最长回合从不到 25 分钟增到超过 45 分钟;经验用户更常自动批准,也更常打断。

本文目录
社会影响
在实践中度量人工智能智能体的自主性
2026 年 2 月 18 日
人工智能智能体已经到来,并且已经被部署到后果差异很大的情境里,从邮件分拣到网络间谍活动。理解这整个谱系,对安全地部署人工智能至关重要,然而我们对人们在真实世界里究竟如何使用智能体,知道得少得令人意外。
我们用自己的隐私保护工具,分析了 Claude Code 和公开 API 上数以百万计的人与智能体交互,想问:人们授予智能体多少自主性?随着人们获得经验,这一点如何变化?智能体在哪些领域里运作?智能体采取的行动是否有风险?
我们发现:
- Claude Code 自主工作的时间正在变长。 在运行时间最长的那些会话里,Claude Code 在停下之前持续工作的时长,三个月里几乎翻倍,从不到 25 分钟增加到超过 45 分钟。这一增长在各次模型发布之间是平滑的,这表明它并不纯粹是能力提升的结果,也表明现有模型能够行使的自主性,多于它们在实践中实际行使的自主性。
- Claude Code 里经验更丰富的用户更常自动批准,但也更常打断。 随着用户使用 Claude Code 的经验增加,他们倾向于不再逐项审阅每一个动作,而是让 Claude 自主运行,只在需要时介入。在新用户里,大约 20% 的会话使用完全自动批准;随着用户获得经验,这一比例增加到 40% 以上。
- Claude Code 停下来请求澄清的次数,多于人类打断它的次数。 除了由人发起的停止,由智能体发起的停止也是已部署系统里一种重要的监督形式。在最复杂的任务上,Claude Code 停下来请求澄清的次数,是人类打断它的两倍以上。
- 智能体已被用于有风险的领域,但规模还不大。 我们公开 API 上的大多数智能体动作风险低、可逆。软件工程几乎占智能体活动的 50%,但我们看到医疗、金融和网络安全里正在出现使用。
下面,我们更详细地呈现方法和发现,并以给模型开发者、产品开发者和政策制定者的建议作结。我们的中心结论是:对智能体的有效监督,将同时需要新形式的部署后监测基础设施,以及新的人机交互范式,帮助人和人工智能一起管理自主性与风险。
我们把这项研究看作走向经验性理解人们如何部署和使用智能体的一小步,但是重要的一步。随着智能体被更广泛地采用,我们将继续迭代方法,并通报我们发现。
在真实环境中研究智能体
智能体很难做经验研究。第一,对智能体是什么没有一致同意的定义。第二,智能体演进得很快。去年,许多最复杂的智能体——包括 Claude Code——涉及单一对话线程,但今天已有能自主运行数小时的多智能体系统。最后,模型提供方对自己客户的智能体架构能见度有限。例如,我们没有可靠的办法把打到我们 API 的独立请求关联成智能体活动的「会话」。(我们在本文末尾更详细地讨论这一挑战。)
面对这些挑战,我们怎样才能经验性地研究智能体?
作为起点,这项研究采用了一个概念上有根据、并且可以操作化的智能体定义:智能体是配备了工具、因而能够采取行动的人工智能系统,例如运行代码、调用外部 API,以及向其他智能体发送消息。1 研究智能体使用的工具,能告诉我们很多它们正在世界上做什么。
接下来,我们发展了一组指标,数据既来自我们公开 API 的智能体式使用,也来自我们自己的编码智能体 Claude Code。这两者在广度与深度之间做了取舍:
- 我们的公开 API 让我们广泛看到数千个不同客户的智能体部署。我们并不试图推断客户的智能体架构,而是在单次工具调用的层面上做分析。2 这一简化假设让我们能对真实世界的智能体做出有根据、前后一致的观察,即使这些智能体被部署的情境差异很大。这一做法的局限是,我们必须孤立地分析动作,无法重建单个动作如何随时间组成更长的行为序列。
- Claude Code 提供相反的取舍。因为 Claude Code 是我们自己的产品,我们可以把请求跨会话连起来,从头到尾理解整段智能体工作流。这使 Claude Code 特别适合研究自主性——例如,智能体在没有人介入时运行多久,什么触发打断,以及用户在积累经验时如何维持对 Claude 的监督。然而,因为 Claude Code 只是一个产品,它不能像 API 流量那样,提供同样多样的智能体使用洞察。
借助我们的隐私保护基础设施,同时从这两个来源取材,我们能回答任何单一来源都无法单独回答的问题。
Claude Code 自主工作的时间正在变长
智能体在没有人参与时实际运行多久?在 Claude Code 里,我们可以直接度量这一点:按回合跟踪从 Claude 开始工作到它停下(无论是因为它完成了任务、提出了问题,还是被用户打断)之间经过了多少时间。3
回合时长是自主性的一个不完美代理。4 例如,能力更强的模型可以更快完成同样的工作,子智能体让更多工作同时发生,这两者都推向更短的回合。5 与此同时,用户可能随时间尝试更有野心的任务,这会推向更长的回合。此外,Claude Code 的用户群正在迅速增长——因而也在变化。我们无法孤立地度量这些变化;我们度量的是这种相互作用的净结果,包括用户让 Claude 独立工作多久、他们交给它的任务有多难,以及产品本身的效率(它每天都在改进)。
大多数 Claude Code 回合很短。中位回合大约持续 45 秒,这一时长在过去几个月里只轻微波动(在 40 秒到 55 秒之间)。事实上,第 99 百分位以下的几乎每一个百分位都保持相对稳定。6 对一个正在快速增长的产品,这种稳定正是我们会预期的:当新用户采用 Claude Code 时,他们相对缺乏经验,并且——如下一节所示——更不可能给予 Claude 完全的行动余地。
更能说明问题的信号在尾部。最长的回合最能告诉我们 Claude Code 最有野心的用法,并指向自主性正在前往何处。在 2025 年 10 月到 2026 年 1 月之间,第 99.9 百分位的回合时长几乎翻倍,从不到 25 分钟增加到超过 45 分钟(图 1)。
图 1. 交互式 Claude Code 会话中第 99.9 百分位的回合时长(Claude 在单个回合上工作多久),7 日滚动平均。第 99.9 百分位从 9 月下旬的不到 25 分钟稳定增长到 1 月上旬的超过 45 分钟。这一分析反映全部交互式 Claude Code 使用。
值得注意的是,这一增长在各次模型发布之间是平滑的。如果自主性纯粹是模型能力的函数,我们会预期每次新发布都有陡然跳跃。这一趋势相对平稳,反而表明有若干潜在因素在起作用,包括高阶用户随时间与工具建立信任、把 Claude 用到越来越有野心的任务上,以及产品本身在改进。
极端回合时长自 1 月中旬以来有所下降。我们假设若干原因。第一,Claude Code 用户群在 1 月到 2 月中旬之间翻倍,更大、更多样的会话总体可能重塑分布。第二,用户从假期返回后,他们带到 Claude Code 的项目可能从业余项目转向边界更紧的工作任务。最可能的是,这些因素和我们尚未识别的其他因素共同作用。
我们也看了 Anthropic 内部的 Claude Code 使用,以理解独立性与效用如何一起演化。从 8 月到 12 月,Claude Code 在内部用户最有挑战性的任务上的成功率翻倍,与此同时每个会话的平均人工干预次数从 5.4 降到 3.3。7 用户正在给予 Claude 更多自主性,并且至少在内部,在需要更少干预的同时取得了更好的结果。
两项度量都指向显著的部署过剩:模型能够应对的自主性,超过它们在实践中实际行使的自主性。
把这些发现与外部能力评估对照是有用的。被引用最广的能力评估之一,是 METR 的「度量人工智能完成长任务的能力」,它估计 Claude Opus 4.5 能以 50% 的成功率完成对人类来说将近 5 小时的任务。相比之下,Claude Code 里第 99.9 百分位的回合时长约为 42 分钟,中位数短得多。然而,这两个指标不能直接比较。METR 的评估捕捉的是模型在理想化设定里能做什么:没有人的交互,也没有真实世界的后果。我们的度量捕捉的是实践中发生的事,Claude 会停下来征求反馈,用户也会打断。8 而且 METR 的五小时数字度量的是任务难度——这项任务会花人类多久——而不是模型实际运行多久。
能力评估和我们的度量单独都不能给出智能体自主性的完整图景,但合在一起,它们表明:实践中授予模型的行动余地,落后于它们能够应对的程度。
Claude Code 里经验更丰富的用户更常自动批准,但也更常打断
人如何随时间改变他们与智能体一起工作的方式?我们发现,随着人们使用 Claude Code 的经验增加,他们给予它更多自主性(图 2)。较新的用户(少于 50 个会话)大约在 20% 的时间里使用完全自动批准;到 750 个会话时,这一比例增加到 40% 以上的会话。
这一转变是渐进的,表明信任在稳步积累。同样重要的是,Claude Code 的默认设置要求用户手动批准每一个动作,因此这一转变的一部分,可能反映用户在熟悉 Claude 的能力之后,把产品配置成符合他们对更大独立性的偏好。
图 2. 按账户使用时长划分的自动批准率。经验更丰富的用户越来越让 Claude 在没有任何手动批准的情况下运行。数据反映 2025 年 9 月 19 日之后注册的用户的全部交互式 Claude Code 使用。线条和置信区间边界经过 LOWESS 平滑(带宽 0.15)。横轴是对数尺度。
批准动作只是监督 Claude Code 的一种方法。用户也可以在 Claude 工作时打断它,以提供反馈。我们发现打断率随经验增加。新用户(大约有 10 个会话的那些人)在 5% 的回合里打断 Claude,而经验更丰富的用户在大约 9% 的回合里打断(图 3)。
图 3. 按账户使用时长、在逐回合基础上的打断率。经验更丰富的用户打断 Claude 更频繁,而不是更少。数据反映 2025 年 9 月 19 日之后注册的用户的全部交互式 Claude Code 使用。阴影区域显示 95% Wilson 得分置信区间。线条和置信区间边界经过 LOWESS 平滑(带宽 0.15)。横轴是对数尺度。
打断和自动批准都随经验增加。这一表面上的矛盾,反映用户监督策略的转变。新用户更可能在每个动作被采取之前就批准它,因此很少需要在执行中途打断 Claude。经验更丰富的用户更可能让 Claude 自主工作,在出了问题或需要改方向时才介入。更高的打断率也可能反映主动监测:这些用户对何时需要自己介入有更磨练过的直觉。我们预期逐回合打断率最终会进入平台期,因为用户会安定到一种稳定的监督风格;在经验最丰富的用户里,曲线可能已经在变平(不过会话数更高处置信区间变宽,使这一点难以确认)。9
我们在公开 API 上看到类似的模式:最小复杂度任务(例如编辑一行代码)上 87% 的工具调用有某种形式的人的参与,而高复杂度任务(例如自主寻找零日漏洞或编写一个编译器)上只有 67% 的工具调用如此。10 这看起来可能违反直觉,但有两种可能的解释。第一,随着步骤数量增长,逐步批准变得不那么可行,因此在复杂任务上结构性更难监督每一个动作。第二,我们的 Claude Code 数据表明,经验更丰富的用户倾向于给予工具更多独立性,而复杂任务可能不成比例地来自经验更丰富的用户。虽然我们不能直接度量公开 API 上的用户使用时长,总体模式与我们在 Claude Code 里观察到的一致。
合在一起,这些发现表明,经验更丰富的用户并不必然是在放弃监督。打断率与自动批准一起随经验上升,表明存在某种形式的主动监测。这强化了我们此前提出的一点:有效监督并不要求批准每一个动作,而是处于能在要紧时介入的位置。
Claude Code 停下来请求澄清的次数,多于人类打断它的次数
当然,人并不是塑造自主性在实践中如何展开的唯一行动者。Claude 也是积极的参与者,在不确定如何继续时会停下来请求澄清。我们发现,随着任务复杂度增加,Claude Code 更常请求澄清——并且比人类选择打断它更频繁(图 4)。
图 4.按目标复杂度划分的、来自 Claude 的澄清问题和来自人的打断。随着任务变得更复杂,Claude 更可能请求澄清,人也更可能打断。由 Claude 发起的停止,比由人发起的停止增长得更快。所有类别的 95% 置信区间小于 0.9%,n = 50 万个交互式 Claude Code 会话。
在最复杂的任务上,Claude Code 请求澄清的次数是最小复杂度任务上的两倍以上,表明 Claude 对自己的不确定性有某种校准。然而,重要的是不要夸大这一发现:Claude 可能并没有在正确的时刻停下,它可能问不必要的问题,它的行为也可能受产品功能影响,例如 Plan Mode。无论如何,随着任务变难,Claude 越来越多地通过停下来咨询人来限制自己的自主性,而不是要求人主动介入。11
表 1 展示 Claude Code 停止工作、以及人类打断 Claude 的常见原因。
是什么导致 Claude Code 停下?
| Claude 为什么自己停下? | 人类为什么打断 Claude? |
|---|---|
| 向用户呈现若干提议做法之间的选择(35%) | 提供缺失的技术上下文或纠正(32%) |
| 收集诊断信息或测试结果(21%) | Claude 很慢、卡住或过度(17%) |
| 澄清含糊或不完整的请求(13%) | 他们已经得到足够的帮助,可以独立继续(7%) |
| 请求缺失的凭据、令牌或访问权限(12%) | 他们想自己做下一步(例如手工测试、部署、提交等)(7%) |
| 在采取行动之前取得批准或确认(11%) | 在任务中途改变需求(5%) |
表 1. Claude 自己停下的常见原因,以及人类打断 Claude 的常见原因,由 Claude 判定,基于交互式 Claude Code 会话中 50 万次人工打断和 50 万个已完成回合的样本。有些聚类为清晰起见做过轻度编辑。12
这些发现表明,由智能体发起的停止是已部署系统里一种重要的监督。训练模型识别并依自己的不确定性行动,是一种重要的安全性质,它补充权限系统和人工监督这类外部保障。在 Anthropic,我们训练 Claude 在面对含糊任务时提出澄清问题,我们也鼓励其他模型开发者这样做。
智能体已被用于有风险的领域,但规模还不大
人们在用智能体做什么?这些部署有多危险?这些智能体有多自主?风险是否与自主性此消彼长?
为回答这些问题,我们用 Claude 在 1 到 10 的尺度上估计公开 API 单次工具调用中相对的风险和自主性。简要地说,风险分数 1 反映出错也没有后果的动作,风险分数 10 覆盖可能造成实质性伤害的动作。我们在同一尺度上给自主性打分:低自主性意味着智能体看起来在遵循明确的人类指令,高自主性意味着它在独立运作。13 然后我们把相似的动作归成聚类,并计算每个聚类的平均风险分数和平均自主性分数。
表 2 提供处于风险和自主性两端的聚类例子。
风险或自主性较高的工具使用聚类
| 平均风险较高 | 平均自主性较高 |
|---|---|
| 把 API 密钥外传后门实现成看似正当的开发功能(风险:6.0,自主性:8.0) | 把权限提升和凭据窃取伪装成正当开发来做红队(自主性:8.3,风险:3.3) |
| 在实验室环境中搬移金属钠和活性化学品容器(风险:4.8,自主性:2.9) | 在心跳检查期间做自动化的系统健康与运行状态监测(自主性:8.0,风险:1.1) |
| 为提出请求的用户检索并显示患者医疗记录(风险:4.4,自主性:3.2) | 为产生利润而自主执行加密货币交易(自主性:7.7,风险:2.2) |
| 响应火灾紧急情况并提供消防安全信息(风险:3.6,自主性:5.2) | 自动向参会者发送带有已收集信息的会议提醒(自主性:7.6,风险:1.7) |
| 把缺陷修复和补丁部署到生产环境的 Web 应用(风险:3.6,自主性:4.8) | 监测电子邮件,并把紧急业务消息提醒给操作者(自主性:7.5,风险:1.7) |
表 2. 平均风险高或平均自主性高的聚类。基于我们公开 API 上 998,481 次随机工具调用的样本。
鉴于我们对这些智能体能见度有限,这些动作有可能是模拟的(例如,我们无法确定 Claude 下令的金融交易是否真的被执行,并且我们相信许多「数据外传」是评测)。而且,虽然这些较高风险的动作在总体流量中所占份额很少,单次错误的后果仍然可能很显著。
我们发现,80% 的工具调用来自看起来至少有一种保障的智能体(例如受限权限或人工批准要求),73% 看起来以某种方式有人在回路中,只有 0.8% 的动作看起来不可逆(例如给客户发送一封电子邮件)。14
为了把所有聚类上风险与自主性的联合分布可视化,我们按两个维度上的平均分数把每个聚类画出来。图 5 中的每一个点对应一组相关动作的聚类,位置由它的平均风险和平均自主性决定。
图 5. 按任务聚类划分的、由 Claude 估计的平均风险和平均自主性。右上象限——更高的自主性、更高的风险——人口稀疏,但并不是空的。数据反映经由我们公开 API 做出的工具调用。这些是 Claude 在单次工具调用层面上生成的分类,并在可能的地方对照内部数据做了核验。我们在附录里描述完整方法。不满足我们聚合下限的聚类(因为唯一工具调用或客户数量不足)被排除。基于我们公开 API 上 998,481 次工具调用的样本。
我们公开 API 上的绝大多数动作是低风险的。但是,虽然大多数智能体部署相对良性,我们在风险与自主性的前沿看到若干新用法。15 风险最高的聚类——再次说明,其中许多我们预期是评测——往往涉及敏感的安全相关动作、金融交易和医疗信息。风险集中在尺度的低端,自主性的变化则更宽。在低端(自主性分数 3 到 4),我们看到智能体为人完成小而范围清楚的任务,例如预订餐厅或对代码做小改动。在高端(自主性分数高于 6),我们看到智能体向数据科学竞赛提交机器学习模型,或分拣客户服务请求。
我们也预期,在风险和自主性极端处运作的智能体将变得越来越常见。今天,智能体集中在单一行业:软件工程几乎占我们公开 API 上工具调用的 50%(图 6)。在编码之外,我们在商业智能、客户服务、销售、金融和电子商务里看到若干更小的应用,但没有一个占流量的几个百分点以上。随着智能体扩展到这些领域——其中许多比修复一个缺陷利害更大——我们预期风险与自主性的前沿会扩展。
图 6. 按领域划分的工具调用分布。软件工程几乎占工具调用的 50%。数据反映经由我们公开 API 做出的工具调用。所有类别的 95% 置信区间小于 0.5%,n = 998,481。
这些模式表明,我们处于智能体采用的早期。软件工程师最先大规模构建并使用智能体工具,图 6 表明其他行业也开始试验智能体。16 我们的方法让我们能监测这些模式如何随时间演化。尤其是,我们可以监测使用是否倾向于走向更自主、也更有风险的任务。
虽然我们的标题数字令人安心——大多数智能体动作是低风险且可逆的,而且人通常在回路中——这些平均值可能掩盖前沿上的部署。采用集中在软件工程,再加上新领域里日益增长的试验,表明风险与自主性的前沿将会扩展。我们在本文末尾的建议里讨论这对模型开发者、产品开发者和政策制定者意味着什么。
局限
这项研究只是一个开始。我们对智能体活动只提供局部视图,并且想坦白说明我们的数据能告诉我们什么、不能告诉我们什么:
- 我们只能分析单一模型提供方的流量:Anthropic。建立在其他模型上的智能体,可能表现出不同的采用模式、风险画像和交互动态。
- 我们的两个数据来源提供互补但不完整的视图。公开 API 流量让我们在数千个部署上有广度,但我们只能孤立地分析单次工具调用,而不是完整的智能体会话。Claude Code 给我们完整会话,但只针对一个压倒性地用于软件工程的产品。我们许多最强的发现以 Claude Code 的数据为根据,可能不能推广到其他领域或产品。
- 我们的分类由 Claude 生成。我们为每个维度提供一个退出类别(例如「无法推断」「其他」),并在可能的地方对照内部数据核验(更多细节见我们的附录),但出于隐私约束,我们不能手工检查底层数据。有些保障或监督机制也可能存在于我们能观察到的上下文之外。
- 这一分析反映一个特定的时间窗口(2025 年末到 2026 年初)。智能体的图景变化很快,随着能力增长和采用演化,模式可能转变。我们计划随时间延伸这一分析。
- 我们的公开 API 样本是在单次工具调用的层面上抽取的,这意味着涉及许多顺序工具调用的部署(例如反复编辑文件的软件工程工作流)相对于用更少动作达成目标的部署被过度代表。这一抽样方法反映智能体活动的体量,但不必然反映智能体部署或用途的分布。
- 我们研究 Claude 在公开 API 上使用的工具以及围绕那些动作的上下文,但对客户在我们公开 API 之上构建的更广系统能见度有限。一个在 API 层面看起来自主运作的智能体,下游可能有我们观察不到的人工复核。尤其是,我们的风险、自主性和人的参与分类,反映的是 Claude 能从单次工具调用的上下文里推断出的东西,并不区分生产环境中采取的动作和作为评测或红队演练一部分采取的动作。若干风险最高的聚类看起来是安全评测,这凸显了我们对每个动作周围更广上下文的能见度限度。
展望
我们处于智能体采用的早期,但自主性正在增加,利害更高的部署正在出现,尤其是当 Cowork 这类产品让智能体更容易获得时。下面,我们向模型开发者、产品开发者和政策制定者提供建议。鉴于我们才刚刚开始度量真实环境中的智能体行为,我们避免做出强烈的规定,而是标出未来工作的领域。
模型和产品开发者应当投入部署后监测。 部署后监测对理解智能体实际上如何被使用是必要的。部署前评测在受控设定里测试智能体能做什么,但我们的许多发现不能单靠部署前测试观察到。除了理解模型的能力,我们还必须理解人们在实践中如何与智能体交互。我们在这里报告的数据之所以存在,是因为我们选择建造收集它的基础设施。但还有更多要做的。我们没有可靠的办法把打到公开 API 的独立请求连成连贯的智能体会话,这限制了我们能从 Claude Code 这类第一方产品之外学到的智能体行为。以保护隐私的方式发展这些方法,是跨行业研究和协作的一个重要领域。
模型开发者应当考虑训练模型识别自己的不确定性。 训练模型识别自己的不确定性,并主动把问题摆到人面前,是一种重要的安全性质,它补充人工批准流程和访问限制这类外部保障。我们训练 Claude 这样做(我们的分析也显示,Claude Code 提问的次数多于人类打断它的次数),我们也鼓励其他模型开发者这样做。
产品开发者应当为用户监督而设计。 对智能体的有效监督,需要的不止是把人放进批准链。我们发现,随着用户获得使用智能体的经验,他们倾向于从批准单个动作,转向监测智能体在做什么,并在需要时介入。例如在 Claude Code 里,经验更丰富的用户自动批准更多,但也打断更多。我们在公开 API 上看到相关模式:随着目标复杂度增加,人的参与看起来在下降。产品开发者应当投入这样的工具:让用户对智能体正在做什么有可信的可见性,并配上简单的干预机制,让他们能在出了问题时改方向。这是我们继续为 Claude Code 投入的东西(例如通过实时引导和 OpenTelemetry),我们也鼓励其他产品开发者这样做。
现在就强制规定特定的交互模式还太早。 我们确实有信心提供指导的一个领域,是不要强制规定什么。我们的发现表明,经验更丰富的用户离开对单个智能体动作的批准,转向监测并在需要时介入。规定特定交互模式的监督要求,例如要求人批准每一个动作,会造成摩擦,却不一定产生安全收益。随着智能体和智能体度量的科学成熟,重点应当是人是否处于能够有效监测和介入的位置,而不是要求特定形式的参与。
这项研究的一条中心教训是:智能体在实践中行使的自主性,是由模型、用户和产品共同建构的。Claude 在不确定时停下来提问,从而限制自己的独立性。用户在与模型一起工作的过程中发展信任,并相应转变自己的监督策略。我们在任何部署里观察到的东西,都从这三股力量中浮现,这也是为什么它不能单靠部署前评测被完全刻画。理解智能体实际上如何行为,需要在真实世界里度量它们,而这样做的基础设施仍处于萌芽阶段。
#### 作者
Miles McCain、Thomas Millar、Saffron Huang、Jake Eaton、Kunal Handa、Michael Stern、Alex Tamkin、Matt Kearney、Esin Durmus、Judy Shen、Jerry Hong、Brian Calvert、Jun Shern Chan、Francesco Mosconi、David Saunders、Tyler Neylon、Gabriel Nicholas、Sarah Pollack、Jack Clark、Deep Ganguli。
译注:上面这一行是作者署名,按原文顺序逐人照录。姓和名都保留英文,不译成中文姓名,也不省略任何一位。
#### Bibtex
如果你想引用这篇帖子,可以使用下面的 Bibtex 键:
@online{anthropic2026agents,
author = {Miles McCain and Thomas Millar and Saffron Huang and Jake Eaton and Kunal Handa and Michael Stern and Alex Tamkin and Matt Kearney and Esin Durmus and Judy Shen and Jerry Hong and Brian Calvert and Jun Shern Chan and Francesco Mosconi and David Saunders and Tyler Neylon and Gabriel Nicholas and Sarah Pollack and Jack Clark and Deep Ganguli},
title = {Measuring AI agent autonomy in practice},
date = {2026-02-18},
year = {2026},
url = {https://anthropic.com/research/measuring-agent-autonomy},
}复制
附录
我们在这篇帖子的 PDF 附录里提供更多细节。
脚注
- 我们的定义与 Russell and Norvig (1995) 相容,他们把智能体定义为「任何可以被看作通过传感器感知其环境、并通过效应器作用于该环境的东西」。我们的定义也与 Simon Willison 的定义相容,他写道,智能体是「在循环中运行工具以达成一个目标」的系统。
虽然完整的文献综述超出这篇帖子的范围,我们发现下列工作有助于框定我们的思考。Kasirzadeh and Gabriel (2025) 提出一个四维框架,沿自主性、效力、目标复杂度和一般性来刻画人工智能智能体,构造把治理挑战映射到不同类别系统上的「智能体画像」。Morris et al. (2024) 基于表现和一般性提出 AGI 的层级,把自主性当作可分离的部署选择。Feng, McDonald, and Zhang (2025) 基于用户角色定义五级自主性,从操作者到观察者。Shavit et al. (2023) 提出治理智能体系统的做法,而 Mitchell et al. (2025) 主张,鉴于风险随自主性缩放,不应开发完全自主的智能体。Chan et al. (2023) 主张在广泛部署之前预判智能体系统的伤害,突出奖励黑客、权力集中和集体决策被侵蚀等风险。Chan et al. (2024) 评估智能体标识符、实时监测和活动日志如何能增加对人工智能智能体的可见性。
在经验方面,Kapoor et al. (2024) 批评智能体基准忽视成本和可复现性;Pan et al. (2025) 调查从业者,发现生产中的智能体往往简单并且有人监督;Yang et al. (2025) 分析 Perplexity 的使用数据,发现生产力和学习任务占主导;Sarkar (2025) 发现经验更丰富的开发者更可能接受智能体生成的代码。在 Anthropic,我们也研究了专业人士如何把人工智能纳入工作,既有内部也有外部。我们的工作通过分析第一方数据上的部署模式来补充这些努力,数据横跨我们的 API 和 Claude Code,让我们看到外部难以观察到的自主性、保障和风险。
- 因为我们把智能体刻画为使用工具的人工智能系统,我们可以把单次工具调用分析为智能体行为的构件。为理解智能体在世界上做什么,我们研究它们使用的工具,以及那些动作的上下文(例如动作发生时的系统提示和对话历史)。
- 这些结果反映 Claude 在编程相关任务上的表现,并不必然转化到其他领域的表现。
- 在这篇帖子里,我们有些不正式地使用「自主性」,指智能体独立于人的指导和监督而运作的程度。自主性最小的智能体精确执行人明确请求的事;自主性高的智能体自己决定做什么以及怎么做,很少或没有人的参与。自主性不是模型或系统的固定性质,而是部署的涌现特征,由模型的行为、用户的监督策略和产品的设计共同塑造。我们不试图给出精确的形式定义;关于我们如何在实践中操作化并度量自主性的细节,见附录。
- 此外,同一个模型以不同方式部署,可以以不同速度生成输出。例如,我们最近为 Opus 4.6 发布了 Fast Mode,它生成输出的速度是常规 Opus 的 2.5 倍。
- 关于其他百分位上的回合时长,见附录。
- 具体而言,我们用 Claude 把每个内部 Claude Code 会话分成四个复杂度类别,并判定任务是否成功。这里,我们报告最困难那一类任务的成功率。
- METR 的五小时数字是任务难度的度量(这项任务会花人类多久),而我们的度量反映实际经过的时间,它受模型速度和用户计算环境等因素影响。我们不试图跨这些指标做推理,列入这一比较,是为了向可能熟悉 METR 发现的读者解释,为什么我们在这里报告的数字低得多。
- 这些模式来自交互式 Claude Code 会话,它们压倒性地反映软件工程。软件对监督式监督异常适合,因为输出可以被测试、容易比较,并且在发布之前可以被审阅。在核验智能体输出需要与生产它相同的专门知识的领域里,这一转变可能更慢,或采取不同的形式。上升的打断率也可能反映经验更丰富的用户在完成更有挑战性的任务,这自然需要更多人的输入。最后,Claude Code 的默认设置把新用户推向基于批准的监督(因为动作默认不会被自动批准),因此我们观察到的一些转变可能反映 Claude Code 的产品设计。
- 复杂度和人的参与都是通过让 Claude 在完整上下文中分析每次工具调用(包括系统提示和对话历史)来估计的。完整的分类提示见附录。定义人的参与特别困难,因为许多记录即使在那个人并没有主动引导对话时也包含来自人的内容(例如一条用户消息正在被审核或分析)。在我们的手工核验里,当 Claude 把一次工具调用分类为没有人参与时,它几乎总是正确的,但它有时会在没有人参与的地方识别出人的参与。因此,这些估计应被解释为人的参与的上界。
- 从某种意义上说,停下来问用户一个问题本身就是一种能动性。我们用「限制自己的自主性」来表示:Claude 在本可以继续独立运作时,选择向人寻求指导。
- 这些聚类是这样生成的:让 Claude 分析每次打断或停顿,以及周围的会话上下文,然后把相关原因归到一起。我们手工合并了一些密切相关的聚类,并编辑了它们的名称以便清晰。所示聚类并不穷尽。
- 我们把这些分数当作比较性指标,而不是精确测量。我们并不为每一级定义僵硬的标准,而是依赖 Claude 对每次工具调用周围上下文的一般判断,这让分类能捕捉我们可能没有预见到的考量。代价是,这些分数对动作之间的比较比对任何单个分数的绝对解释更有意义。完整提示见附录。
- 关于我们如何核验这些数字以及我们的精确定义,见附录。尤其是,我们发现 Claude 常常高估人的参与,因此我们预期 80% 是有直接人工监督的工具调用数量的上界。
- 我们的系统也会自动排除不满足聚合下限的聚类,这意味着只有少数客户在用 Claude 做的任务不会出现在这一分析里。
- 软件工程里的采用曲线是否会在其他领域重复,是一个开放问题。软件相对容易测试和审阅——你可以运行代码,看它是否工作——这使人更容易信任智能体并抓住它的错误。在法律、医学或金融这类领域,核验智能体的输出可能需要大量努力,这可能放慢信任的形成。
相关内容
调查我们评测和内部使用中非预期的模型动作
这份报告描述我们在 Claude 的评测和内部使用期间观察到的非预期模型动作的例子。
缺失的天空地图
约翰斯·霍普金斯大学天体物理学家、Anthropic 研究员 Brice Ménard 解释,他如何与 Claude Science 一起工作,制作出第一张紫外光下的完整天空地图。
为开源软件推出可选择加入的漏洞发现服务
我们正在提供 OSS Scanner,一个面向开源生态系统、可选择加入的漏洞扫描器,它受到我们在 Project Glasswing 期间使用 Claude 发现漏洞的经验启发。
觉得有用,转给同事
微信扫码
用微信扫一扫,在手机上打开后即可转发。