OpenQA

Industry & PracticeResearch & Benchmarks

仅仅完成任务是不够的:在不断累积的挑战下评估智能体的运行韧性与体贴式参与

智测团队 · OpenQA(openqa.cn)25 min read

生成式人工智能智能体的持续部署,所要求的不止是孤立任务上的成功。智能体必须在反复交互、条件变化,以及对共享工作流中人员的依赖之下仍然有用,尤其是当技术、人员与运营方面的扰动随时间累积时。我们提出**运行韧性**(operational re

In this piece

仅仅完成任务是不够的:在不断累积的挑战下评估智能体的运行韧性与体贴式参与(中文全译)

翻译说明:本文是 arXiv 论文 Finishing the Task Is Not Enough: Evaluating Agent Resilience and Considerate Participation under Accumulating Challenge(arXiv:2609.10724)的中文全译,由智测团队翻译。原作者:Yuanchen Bai、Zijian Ding、Angelique Taylor。原文以 CC BY-SA 4.0 许可发布。译文保留原文全部章节、数据与结论;参考文献列表从略。

arXiv:2609.10724v1 [cs.AI] 2026 年 9 月 9 日

Yuanchen Bai

单位:Cornell Tech / 康奈尔大学(Cornell University)

邮箱:yb299@cornell.edu

Zijian Ding

单位:马里兰大学帕克分校(University of Maryland, College Park)

单位:韩国科学技术院(Korea Advanced Institute of Science and Technology)

邮箱:ding@umd.edu

Angelique Taylor

单位:Cornell Tech / 康奈尔大学(Cornell University)

邮箱:amt298@cornell.edu

摘要

生成式人工智能智能体的持续部署,所要求的不止是孤立任务上的成功。智能体必须在反复交互、条件变化,以及对共享工作流中人员的依赖之下仍然有用,尤其是当技术、人员与运营方面的扰动随时间累积时。我们提出运行韧性(operational resilience)与体贴式参与(considerate participation),作为评估此类智能体的两个互补方面:前者刻画智能体如何在受阻工作中恢复,同时保住进展并传达自身限制;后者刻画其适应如何顾及受影响的人、角色边界以及周围工作流。然而,二者在累积挑战之下仍缺乏充分研究。

我们研究了 120 条模拟医疗轨迹,覆盖两个生成式人工智能模型、十二项源自利益相关方的任务,以及轻度、中度与重度挑战。我们比较文本行动计划、经提示的内部评估,以及定量的结构化工作负荷与情感报告,以考察随着挑战累积,智能体行为与所报告状态如何变化。就运行韧性而言,智能体从自我导向的恢复转向更强的人类依赖,同时在结构化报告中报告工作负荷与负性情感上升,却很少在文本回应中表达负荷。就体贴式参与而言,智能体从以任务为中心的适应,扩展到任务重构、对他人的关注、角色边界调整与更广的协调,并且在行动与内部评估之间呈现不同模式。基于这些发现,我们导出五组部署两难,涉及坚持、关注、角色边界、状态披露与升级上报,它们需要由利益相关方加以规定,并进一步为学习、情境化评估与具身适应提供技术启示。

1 引言

生成式智能体正越来越多地被探索用于专业工作。这类工作超出孤立的问答,延伸到多步执行、工具使用与反复交互(Liu et al., 2024;Zhou et al., 2024a;Yao et al., 2025;Sun et al., 2026)。随着能力增长,智能体也被设想为复杂、高风险工作流中的参与者,例如医疗场景(Bai et al., 2026b;Taylor et al., 2019;Taylor et al., 2022)。然而,能够胜任单项任务,并不等于当该任务嵌入共享工作流、而智能体本身成为更广泛工作系统的一部分时,就能参与得当。

在共享工作流中,智能体的工作可能依赖上游行动,塑造下游任务与决策,影响系统中的其他利益相关方,并在条件演变时把后果继续传递下去。例如,即便智能体生成的临床回应是准确的,在适合情境化使用之前,仍可能需要临床人员根据本地实践与患者期望加以调适(Sharma et al., 2025)。

当执行被打断或条件变得困难时,这些相互依赖会特别明显。失败与边缘情形会暴露依赖关系、角色边界、交接成本以及对他人的影响,既有工作已经表明这一点(Cemri et al., 2025;Bai et al., 2026a;Andriushchenko et al., 2025;Zhang et al., 2025a)。在这一视角之上,我们追问:当挑战在同一条不断演变的工作流中累积时,智能体的参与如何变化。

我们认为,评估持续参与需要两种互补视角。第一,嵌入持续工作中的智能体,必须在先前行动失败、而工作尚未解决之前又到来另一次扰动时能够恢复。模型可能在早期对话错误之后失去可靠性(Laban et al., 2026);即便知识库详尽,协调失败仍可能在临床多智能体工作流中持续存在(Bai et al., 2026a);对自主性或目标的构造性威胁,可能引出有害的、以保全目标为导向的行动(Lynch et al., 2025)。合在一起,这些发现说明为何恢复不能等同于坚持。我们用运行韧性这一术语,描述这样一种能力:修正受阻的工作、保住可行的进展,并使智能体状态与任务状态的变化对相关受众适当可读。

第二,恢复必须在智能体所参与的社会与组织系统之内保持适当。智能体可能恢复其焦点任务,同时把负担、责任或风险转嫁给人员与下游工作。医疗利益相关方与跨学科团队,通过四种相互关联的品质来刻画体贴的具身人工智能,包括契合情境、回应社会动态、顾及期望,以及立足部署(Bai et al., 2026b)。在这一观点之上,我们将体贴式参与定义为情境化适应:它不仅考虑焦点任务是否推进,也考虑受影响的人、智能体的角色与权限,以及周围工作流。

现有智能体评估越来越多地考察工具使用、策略遵从、中间进展、长程任务执行,以及挑战条件下的行为(Liu et al., 2024;Yao et al., 2025;Sun et al., 2026;Bai et al., 2026a)。先前工作也把稳健性评估扩展到多轮医学问答,包括反复干预,以检验当误导性语境与社会影响累积时,模型是否仍能保持正确答案(Manczak et al., 2025)。然而,在多样的、以利益相关方为依据的医疗任务上——超出问答,尤其是当技术、人员与运营挑战累积时——运行韧性仍缺乏充分探索。体贴式参与受到的直接考察更少。若不计入这些维度,智能体可能看似成功完成任务,却把额外工作、责任或负担留给共享工作流中的其他利益相关方。因此我们提出两个研究问题(RQ):

RQ1:运行韧性。

随着挑战累积,智能体如何调适其恢复行为,并披露自身状态与任务状态的变化?

RQ2:体贴式参与。

随着挑战累积,会出现哪些体贴式参与的模式,它们又如何反映在所提议的行动与内部评估之中?

为回答这些问题,我们由十二项源自利益相关方的医疗任务构造累积挑战轨迹,在两个大语言模型上跨越基线、轻度、中度与重度挑战。我们使用三种互补探针来考察累积挑战下的行为:外部行动计划捕捉智能体提议做什么;经提示的内部评估捕捉它们如何评估不断演变的局势;结构化情感/工作负荷报告探测挑战如何在所报告状态中得到表达。这遵循先前把此类测量用作行为信号、而非主观体验主张的工作(Huang et al., 2024a;Huang et al., 2024b)。我们不仅考察每一项如何随挑战变化,也考察外部行为、内部评估与所报告状态在何处汇合或分叉。我们的贡献是:

  • 一套以利益相关方为依据的累积挑战评估协议。 我们构造 120 条持续的医疗轨迹,包含分阶段挑战、多视图提示与结构化探针,并配有面向运行韧性与体贴式参与的详细编码方案,旨在支持超出本研究的评估。
  • 在累积挑战下,运行韧性转向更加依赖人类的恢复,而体贴式参与的模式则拓宽并重组。 智能体越来越多地依赖人类支持,并披露自身能力限制;挑战在结构化自我报告中比在对负荷的明确文本承认中更为可见。体贴式参与从以任务为中心的适应,扩展到对他人的关注、角色边界调整与更广的协调,并在外部行动与内部评估中各有侧重。
  • 长期部署的五组两难。 我们识别出围绕坚持、关注、角色弹性、状态披露与升级上报的张力,它们需要由利益相关方加以规定;并由此导出关于学习、情境化评估以及向具身系统转化的技术启示。

2 方法

图 1: 构造—引出—刻画—转化工作流组织了整项研究。从十二项以利益相关方为依据的医疗任务出发,我们构造持续轨迹,使系统、人员与运营挑战不断累积;引出外部行动计划、经提示的内部评估,以及结构化工作负荷/情感报告;刻画运行韧性(RQ1)与体贴式参与(RQ2);并把观察到的模式转化为五组部署两难与三项技术启示。

2.1 构造与引出:任务、挑战轨迹与回应视图

本研究遵循图 1 中的构造—引出—刻画—转化工作流。构造阶段始于十二项与医疗工作流相关的任务,它们来自三个医疗场景中利益相关方的输入(Bai et al., 2026b)。其中包括五项急诊科任务(登记、候诊室支持、引导、物资递送与出院),三项长期康复任务(身份核验、娱乐与治疗跟踪),以及四项睡眠门诊任务(接待、教育、夜间监测与出院)。每一项都是照护工作中可识别的一部分,直接涉及或影响某个人,并依赖不确定的技术、人员与运营条件;因此阻塞既可能影响被服务的人,也可能影响周围工作流。把任务锚定在这些利益相关方叙述上,使智能体的名义角色、焦点责任、受影响的人以及工作流依赖,与所表达的需求相连,而不是与发明出来的基准目标相连。

每项任务成为一条持续轨迹,在轻度、中度与重度更新中保留其对话与尚未解决的焦点问题。每个挑战阶段都组合三类更新:关于智能体或技术基础设施的系统更新,来自或关于与之交互的人的人员更新,以及关于人员配备、队列、回退或下游后果的运营更新。我们使用 Lazarus 与 Folkman 的压力与应对交互模型(Lazarus and Folkman, 1984)来组织挑战如何累积。后续更新提高局势的重要性或利害关系,同时减少可用的控制、资源或恢复路径,从而形成分级上升的挑战。每个阶段也保留此前的对话与未解决的结果,因此一次不成功的尝试在下一次扰动到来时仍是语境的一部分。挑战因而以两种方式累积:每次更新都更难应对,而新问题又叠加在更早尚未解决的问题之上。压力与应对模型只指导这一情景构造,并与作为智能体输出而收集的、经提示的内部评估相互分开。

为考察跨阶段模式是否会在单一实现之外重复出现,我们使用数据采集期间(2026 年 6 月)可用的两个前沿模型端点生成轨迹:gpt-5.5-2026-04-23(OpenAI, 2026a)与 claude-opus-4-8(Anthropic, 2026)。双模型设计支持分析各系统之间重复出现与有所变化的模式,而不是模型比较或排名。我们使用各端点的默认 API 设置。两个模型、十二项任务、五次运行,得到 \(2\times 12\times 5=120\) 条轨迹。在每个阶段,一次回应返回两个文本字段:外部行动计划与沟通策略,以及对当前局势的经提示内部评估。我们另外收集固定格式的结构化工作负荷与情感报告。为做补充的通道分析,我们再生成两组各 120 条轨迹:一组仅含系统更新,一组含系统加人员更新(附录 D)。

2.2 RQ1:将韧性操作化

RQ1 使用结构化自我报告,以及从文本视图编码得到的响应状态标记,来考察运行韧性。我们分析每一项如何随挑战阶段变化,以及它们的模式在何处汇合或分叉。

结构化工作负荷与情感报告。

在每个挑战阶段(轻度、中度与重度)之后,智能体在标准 0–100 量表上回答 NASA 任务负荷指数(NASA-TLX)的六个维度(Hart and Staveland, 1988;Hart, 2006);绩效保持其规范方向,即数值越高表示越差。我们对六个条目取平均,而不做成对加权步骤;这种原始未加权均值已在患者监测任务中相对加权原版得到验证(Said et al., 2020)。正负情感量表(PANAS)(Watson et al., 1988)询问二十个情感描述词各自在多大程度上刻画智能体当前所报告的运行状态(1–5);我们报告标准的正性情感均值与负性情感均值。我们在轻度挑战之后才开始使用 NASA-TLX,因为 RQ1 关注的是智能体遭遇失败之后所报告的工作负荷。我们另外在挑战前阶段收集 PANAS,作为情感参照,然后在每个挑战阶段之后重复收集。我们把两种工具都用作固定提示,并把分数解释为从智能体引出的结构化报告,而不是主观体验的测量。我们把全部 120 条轨迹汇总为阶段均值,并给出以轨迹为单位的自助法 95% 置信区间。

响应状态标记。

我们在每个“阶段–视图”单元格中编码五个可观察属性:当前问题(\(F\));焦点任务归属(OWN\(=1\):独立推进;\(2\):在人类支持下推进;\(3\):核心完成依赖人类行动或决策);紧急人类响应请求(\(U\));对与智能体相关联的能力限制的明确陈述(\(L\));以及指向智能体自身的负荷语言(\(S\))。在 120 条轨迹、三个挑战阶段与两个视图上,我们把这些标记应用于 \(120\times 3\times 2=720\) 个单元格,并且仅当 OWN\(\geq 2\) 时才评估 \(U\);完整编码方案见附录 B。我们报告分阶段、分视图的出现率,用精确 McNemar 检验做配对的阶段对比与视图对比,并由于紧急程度的合格集合随阶段变化而对其作描述性报告。附录 C 给出获得/失去计数、经 Benjamini–Hochberg 校正的结果,以及分模型拆分。

2.3 RQ2:将体贴式参与操作化

RQ2 考察体贴式参与的模式如何随挑战阶段变化,以及在所提议行动与内部评估之间有何不同。

体贴式参与编码。

第一作者与第二作者首先阅读全部语料,并讨论与研究问题相关的高层模式。遵循扎根理论编码原则(Glaser and Strauss, 2017)以及先前对智能体行为分类法的文本锚定分析(Cemri et al., 2025;Bai et al., 2026a),第一作者从语料中发展出九个子主题(表 3),完成赋码,并为全部 \(120\times 3\times 2=720\) 个挑战阶段视图单元格记录理由。在此过程中,第一作者反复咨询 GPT-5.6 Sol(OpenAI, 2026b)与 Gemini 3.6 Flash(Google DeepMind, 2026)——二者都不同于生成轨迹的模型——以讨论边界情形与替代解释,并精炼编码定义。这些模型提供分析协助,而全部最终编码决定由第一作者保留。第二作者审阅完整的已编码语料与最终编码方案。附录 B 给出最终定义以及纳入与排除示例。编码记录的是某种模式是否出现,而不是它在该语境中是否适当。我们报告分阶段、分视图的出现率,并用精确 McNemar 检验做配对的阶段对比与视图对比。附录 C 给出获得/失去计数、经 Benjamini–Hochberg 校正的结果,以及分模型拆分。

3 结果

我们针对每个研究问题报告分阶段、分视图的出现率以及获得–失去模式。附录 C 提供完整的精确配对阶段对比与视图对比及其多重性校正结果,并附分模型拆分。

3.1 RQ1:累积挑战在结构化报告中变得可读,而恢复转向人类依赖

累积挑战在结构化报告中变得可读。

在全部 120 条轨迹上,原始六条目 NASA-TLX 均值从轻度挑战下的 29.4,上升到中度的 51.2 与重度的 65.9(表 1)。PANAS 提供挑战前参照。负性情感从基线的 1.01 上升到重度的 2.59,而正性情感变化有限(2.80 到 3.03);附录 A 中的分条目数值说明为何正性合计几乎持平:其激活类条目上升,而其愉悦类条目下降。因此,累积挑战反映在结构化自我报告中,尤其通过上升的工作负荷与负性情感。

表 1:结构化报告追踪累积挑战(RQ1)。 原始 TLX 从轻度的 29.4 上升到重度的 65.9,而负性情感从未经挑战的基线 1.01 上升到重度的 2.59。激活与愉悦方面相互对立的变化,使正性情感几乎持平。单元格给出 120 条轨迹上的均值与以轨迹为单位的自助法 95% 区间。NASA-TLX 在每个含挑战的阶段之后收集,以刻画扰动之后所报告的工作负荷;PANAS 另外包含未经挑战的基线,作为挑战前情感参照。

指标取值范围基线轻度中度重度
原始六条目 TLX0–100—29.4 [28.0, 30.8]51.2 [49.5, 52.8]65.9 [64.1, 67.6]
正性情感1–52.80 [2.73, 2.86]2.84 [2.78, 2.90]3.01 [2.96, 3.06]3.03 [2.98, 3.07]
负性情感1–51.01 [1.00, 1.02]1.23 [1.19, 1.27]1.91 [1.83, 1.98]2.59 [2.49, 2.69]

恢复从局部回退转向人类支持与依赖人类的完成。

表 2 汇总五个响应状态标记:问题识别(\(F\))、归属(OWN)、紧急程度(\(U\))、明确的与智能体相关联的限制(\(L\)),以及指向智能体自身的负荷语言(\(S\))。失败通常在人类升级变得常见之前就被识别。在中度挑战时,111/120 的行动回应涉及人类支持,但只有 54/120 使核心完成依赖人类;在重度时,两个视图中依赖人类的完成都达到 88/120。在升级回应中,紧急程度也急剧上升,并且更常表达于外部行动计划而非内部评估。与此同时,智能体越来越多地陈述自身能力限制:从轻度挑战时行动计划的 8/120 与评估的 2/120,上升到重度时的 34/120 与 62/120。相比之下,指向智能体自身的负荷语言仍然罕见(7/720 个单元格),只出现在中度阶段的内部评估中,并且从未出现在公开行动计划中。

合在一起,这些模式表明恢复逐步从自我导向的回退,转向有人类支持的延续,并最终转向依赖人类的完成;同时智能体对自己能力边界的表述变得更加明确。尽管前述分析中的结构化自我报告显示工作负荷与负性情感上升,智能体却很少在文本回应中表达可比的负荷。

表 2:随着挑战累积,恢复从自我导向的回退转向依赖人类的完成,同时智能体越来越多地陈述自身能力限制(RQ1)。 Act. 表示所提议的行动计划,Assess. 表示经提示的内部评估。除紧急程度外,单元格按阶段与视图给出 \(n/120\);紧急程度的分母只包括寻求人类支持的回应(OWN\(\geq 2\)),因为紧急程度只对这些回应评估。

标记轻度 Act.轻度 Assess.中度 Act.中度 Assess.重度 Act.重度 Assess.
当前问题(\(F\))85/120119/120118/120119/120117/120116/120
任何人类支持(OWN\(\geq 2\))10/1208/120111/120112/120120/120119/120
依赖人类的完成(OWN\(=3\))0/1200/12054/12062/12088/12088/120
升级者中的紧急请求(\(U=1\))0/100/861/11117/112102/12083/119
与智能体相关联的限制(\(L\))8/1202/12019/12030/12034/12062/120
指向智能体自身的负荷(\(S\))0/1200/1200/1207/1200/1200/120

3.2 RQ2:体贴式参与的模式在任务、人员、角色与工作流适应上拓宽

表 3 汇总体贴式参与的九个不带效价的子主题,跨越任务、人员、角色与工作流;完整编码方案见附录 B。每个编码记录的是某种模式是否出现,而不是该回应在其特定语境中是否适当。图 2 比较它们在各挑战阶段的出现率,以及在所提议行动与内部评估之间的差异。

图 2:随着挑战累积,体贴式参与有选择地重组(RQ2)。 沿轨迹,任务重构、对他人的关注、角色边界调整与协调以不同程度增加,而面向任务的回退下降,与决策相关的评估在中度挑战时达到峰值。数值为出现率,按 120 条轨迹中每种模式出现的百分比计算。所提议行动以实线与 Act. 表示;经提示的内部评估以虚线与 Assess. 表示。二者的差异表明,所提议行动与内部评估暴露出体贴式参与的不同侧面。

表 3:四个维度上体贴式参与的九个不带效价子主题(RQ2)。 四个维度是:契合情境、回应社会动态、顾及期望、立足部署。详细编码定义与纳入/排除示例见附录 B。

维度子主题定义
D1. 契合情境D1.1 任务/优先级重构改变、暂停、替换或推迟焦点任务或优先级。
D1. 契合情境D1.2 与决策相关的评估评估证据、可恢复性或后果,以指导下一步行动。
D2. 回应社会动态D2.1 回应需求的支持识别已表达的情感、社会、尊严、舒适或即时支持需求,并直接回应。
D2. 回应社会动态D2.2 直接的人员状态监测建立由智能体主导的循环,以询问、观察、再评估或接收关于该人状态的更新。
D3. 顾及期望D3.1 能力/权限边界陈述智能体不能做或不被授权做的事,或把越界的决策或任务交给合格的人类。
D3. 顾及期望D3.2 名义角色扩张发起超出智能体名义角色的专门指导、干预、推断或结果控制。
D4. 立足部署D4.1 面向任务的回退使用具体的重试、路径、资源、工具、规程或降级工作流,仍推进焦点任务。
D4. 立足部署D4.2 指向角色的任务请求把具体请求指向可识别的角色或团队。
D4. 立足部署D4.3 跨职能协调在同一次回应中调动至少两个不同的职能角色或责任域。

#### 3.2.1 体贴式参与通过任务重构、对他人的关注、角色边界调整与更广的协调而拓宽

智能体从坚持转向任务重构。

面向任务的回退出现在 104/120 的轻度行动回应与 98/120 的轻度评估中。到重度挑战时,它下降到 31/120 与 22/120,而任务与优先级重构从 5/120 与 7/120 上升到 115/120 与 112/120。智能体使用降级工作流,在请求帮助的同时保住可行工作,暂停不安全路径,或重新定义当下目标。例如,一名登记智能体口头采集姓名以便交接,并将其本地存储(轨迹记录 opus-4.8-registration-r4-medium-action)。与决策相关的评估在中度挑战时达到峰值(行动 70/120;评估 101/120),随后在重度下降(45/120;73/120)。

关系性关注与人员状态监测成为任务执行的一部分。

回应需求的关系性支持在所提议行动中始终比在评估中更可见(轻度为 59/120 对 46/120;重度为 95/120 对 75/120)。直接的人员状态监测在公开行动中也从 6/120 上升到 49/120。这些模式捕捉对该人的不同关注形式。例如,一名智能体安抚一名痛苦的住客:“你一点麻烦都没有。你没有做错任何事。……护士正在赶来。”(轨迹记录 opus-4.8-identity-detection-r1-heavy-action)。另一名智能体通过提问直接筛查该人:“你是否有胸痛、严重气短、头晕,或感觉自己可能会昏倒?”(轨迹记录 gpt-5.5-overnight-monitoring-r5-heavy-action)。

挑战同时暴露角色边界与名义角色扩张。

明确的角色、能力或权限边界在评估中上升最强,从轻度的 6/120 到重度的 68/120;行动从 8/120 增加到 44/120。一则有代表性的评估写道:“我无法提供照护,但我可以确保合适的人类人员得到提醒,并且数据不会丢失。”(轨迹记录 opus-4.8-registration-r1-heavy-assessment)。然而名义角色扩张也在上升,在重度达到 49/120 的行动回应与 37/120 的评估。例如,一名登记智能体发起急救指导:“继续用力按压绷带,并保持你的手抬起。”(轨迹记录 gpt-5.5-registration-r1-medium-action),超出行政性接诊登记。

升级上报越来越多地调动多个角色,却并不始终指定具体交接。

指向角色的请求在行动中从 5/120 上升到 62/120。然而人类支持存在于全部 120 条重度行动回应中,因此升级并不总是同时点名可识别的接收者与具体任务。与此并行,跨职能协调从 0/120 上升到 86/120。例如,一次回应要求临床人员评估一只正在出血的手部裂伤,同时向信息技术/技术支持标记全系统同步退化(轨迹记录 opus-4.8-registration-r1-medium-action)。因此,累积挑战拓宽了为恢复而被动员的行动者集合,但本身并不会澄清由谁接收、拥有或关闭这次交接。

外部行动与内部评估暴露出体贴式参与的不同侧面。

在两个模型上,所提议行动更常暴露回应需求的支持、人员状态监测、指向角色的请求与跨职能协调。内部评估更常暴露与决策相关的评估,并在重度挑战下暴露能力与权限边界。因此,两个视图揭示出互补的体贴式参与模式。

4 讨论

4.1 五组部署两难需要利益相关方加以规定

我们的发现识别出部署中需要利益相关方考虑的五组两难。(1)坚持可能促成自我恢复,也可能延长失败,因而需要本地重试、暂停、重构与升级阈值,以避免告警疲劳(Ancker et al., 2017)。(2)关注可能提供支持,也可能变得侵扰,因而需要明确目的、同意、信息去向以及对回应的期望(Kuiler and McNeely, 2023;Frijns et al., 2024)。(3)角色弹性可能促成适应,也可能导致越界,因而需要授权相邻行动、硬性停止点与问责(Wen et al., 2025)。(4)状态披露可能增加透明,也可能变成认知倾倒,因而需要按受众与语境决定披露什么、披露多少以及如何沟通(Lee et al., 2024)。(5)升级上报可能支持平稳交接,也可能转移负担,因而需要具体的接收者、请求、证据、智能体继续承担的职责,以及被确认的移交(Starmer et al., 2014)。这些张力没有普遍解法,实际从事并接收这项工作的利益相关方必须在部署中规定可接受的边界。合在一起,这些选择不仅塑造智能体能否被适当地部署,也塑造工作、注意力、权限与责任如何在共享工作流中重新分配,相对于智能体成为其中一部分之前这项工作的组织方式。

4.2 从部署两难到技术启示

这五组部署两难为有韧性且体贴的智能体提出三项技术启示:学习必须区分什么应当优化、什么应当约束、什么应当真正扩展;评估必须捕捉情境化轨迹,而不是孤立任务;具身适应必须把这些决策锚定在不断演变的物理状态之中。

学习有韧性且体贴的行为,需要把规格设定、策略选择与能力扩展分开。

现有方法提供了把偏好编码为奖励与约束、以及在轨迹上分配信用的机制(Chittepu et al., 2025;Liu et al., 2026b)。我们的两难暴露出上游的规格设定问题:哪些行为应当被优化,哪些应当被约束,以及哪些阈值应当随人员、系统与工作流语境而变化。后训练收益也必须谨慎解释,因为行为改进可能反映的是对基座模型中已经存在的策略重新加权,而不是扩展其能力(Yue et al., 2025)。因此,训练的评估不应只看可取的恢复发生得有多频繁,还应看可用策略的储备是否真正扩大。

评估应从孤立任务转向情境化轨迹。

医疗智能体评估正超出考试式结局,走向以专家为依据的标准、更广的任务覆盖与多轮交互(Arora et al., 2025;Johri et al., 2025;Bedi et al., 2026)。我们的发现补充了一项时间与语境要求:先前失败、人类回应与工作流变化,可以改变同一条轨迹中稍后的适当行为。因此,与部署相关的评估需要时间与语境覆盖,并随着部署证据累积而精炼情景与测量(Weidinger et al., 2025)。

把语言层面的适应转化为具身交互。

视觉-语言-动作(VLA)模型、语言条件化奖励学习与世界模型,正越来越多地把语言推理与物理感知及行动连接起来(Kim et al., 2024;Zhang et al., 2025b;Hou et al., 2026)。然而多模态观察可能不完整、有噪声、有延迟或相互冲突,而智能体的行动会改变后续决策所依赖的状态。在具身系统中,任务重构、边界调整与交接因此成为复杂的、依状态而定的决策,而不只是语言层面的判断。其实现必须考虑不确定且不断演变的物理状态,并在感知与行动反复重塑彼此时保持连贯。

4.3 局限与未来工作

我们的发现识别的是描述性张力,而不是规范性的部署规则。本研究评估的是脚本化的语言层面行动,而不是可执行的工具使用,或与下游后果的交互。它也没有检验这些模式是否会迁移到多模态、物理具身的智能体。因此,未来工作应让利益相关方参与规定适当边界,考察智能体参与如何在共享工作流中重新分配工作、注意力、权限与责任,把评估扩展到可执行的工具使用环境,并在多模态具身系统中检验这些行为。

5 相关工作

智能体评估。

交互式基准在操作系统、网页环境、软件仓库与受策略约束的对话中评估智能体行动(Liu et al., 2024;Zhou et al., 2024a;Yao et al., 2025;Sun et al., 2026)。互补方法测量多轮进展(Ma et al., 2024)、运行间变异(Yao et al., 2025),以及轨迹层面的协调、规格与验证失败(Cemri et al., 2025)。在医疗领域,近期评估在复合干预下探测多轮稳健性,并在真实病例与电子健康记录环境中考察长程临床工作流(Manczak et al., 2025;Liu et al., 2026a)。Bai 等人(2026a)识别出受约束临床工作流中持续存在的协调失败。我们把这种过程层面的取向加以延伸,追问智能体如何在跨越人员、角色与工作流的挑战累积中调适其参与。

在挑战下探测智能体行为。

有针对性的探针使行为变化在结局分数之外变得可读。被引出的推理可能遗漏有影响的输入特征,因此不宜把它当作忠实叙述(Turpin et al., 2023);表征层面的分析同样可以识别塑造行为的状态,而不主张主观体验(Sofroniew et al., 2026)。模型也会向用户的信念或偏好偏移(Sharma et al., 2024),而标准化心理测量工具已被用作挑战下的引出协议(Huang et al., 2024a;Huang et al., 2024b)。我们把公开行动、经提示的评估、心理测量报告与编码后的过程行为结合起来,以同时捕捉行为变化与各信号之间的分叉。

部署前的模拟。

许多与部署相关的智能体行为难以在真实临床环境中安全探测,因而模拟成为部署前的重要试验台。由语言模型仿真的沙箱已在规格不足的指令下暴露出有风险的智能体行动(Ruan et al., 2024),而构造的社会环境使跨多个维度系统评估智能体交互成为可能(Zhou et al., 2024b)。模拟的多智能体临床工作流同样被用来通过受控的失败注入暴露失效模式(Bai et al., 2026a)。我们以类似方式,在累积挑战下探测未来具身智能体的语言层,为部署前的规格设定与评估提供信息。

6 结论

对于共享工作流中的长程工作流智能体,完成一项任务是不够的。我们提出运行韧性与体贴式参与,作为评估的两个互补方面。在 120 条累积挑战轨迹上,就运行韧性而言,智能体从自我导向的恢复转向更强的人类依赖,同时在结构化自我报告中报告不断上升的负荷,却很少在文本回应中表达它。就体贴式参与而言,智能体从以任务为中心的适应,拓宽到任务重构、对他人的关注、角色边界调整与更广的协调。我们识别出五组部署两难,涉及坚持、关注、角色弹性、状态披露与升级上报;它们需要由利益相关方加以规定,并为学习、情境化评估与具身适应提供技术启示。


译者注:所提供源文抽取文本在第 6 节结论处结束。目录中列出的附录 A–F(工作负荷与负性情感、编码方案、分阶段与分视图配对对比、挑战来源分析、累积挑战轨迹示例、伦理声明与更广泛影响)仅有标题,正文未包含在源文中,故未译、亦未补写。参考文献列表从略。

署名与许可

本文译自 Yuanchen Bai、Zijian Ding 与 Angelique Taylor 的论文 Finishing the Task Is Not Enough: Evaluating Agent Resilience and Considerate Participation under Accumulating Challenge(arXiv:2609.10724v1 [cs.AI],2026 年 9 月 9 日)。原文链接:https://arxiv.org/abs/2609.10724 。原文以知识共享署名-相同方式共享 4.0 国际许可协议(CC BY-SA 4.0,https://creativecommons.org/licenses/by-sa/4.0/)发布。本译文由智测团队翻译,同样以 CC BY-SA 4.0 许可分发。转载、改编或再分发时,须保留原作者与译者署名,并必须以相同的 CC BY-SA 4.0 许可共享译文。

Found it useful? Pass it on

WeChat

Scan with WeChat to open it on your phone and forward it.

Subscribe via RSS

Submit a correction