UserProxyBench: 用户 模拟 器 会 改写 智能 体 基准 结果
把智能体固定为 GPT-5.5、只换用户代理,375 道企业任务的平均奖励变动 15.2 分。成功回合里 24.4% 违反用户合同,主因是过早披露;它几乎不改变奖励,却让智能体平均少做 1.06 次工具调用。

本文目录
UserProxyBench:评测用于智能体基准与训练的大语言模型用户模拟器
交互式智能体基准和多轮强化学习,越来越多地把第二个语言模型放在用户的位置上。这个被模拟的用户控制智能体何时、收到什么信息,但现有基准只给智能体打分,并不直接测量用户是否正确执行了分配给它的角色。我们提出 UserProxyBench,一层盖在 $\tau$-bench 家族之上的评测。$\tau$-bench(tau-bench)是一套评测工具型对话智能体在真实业务域里与用户和工具交互的基准。同时提出用户忠实度分数(User Fidelity Score,UFS):用与任务绑定的评分标准,衡量代理是否遵守基准私下交给它的用户指令,打分独立于智能体是否成功。用户代理(user proxy)是由另一个语言模型扮演的用户。把智能体固定为 GPT-5.5,只更换用户代理,在 375 道企业任务上,平均任务奖励会变动 15.2 分;同时,成功回合里有 24.4% 含有违反用户规格的行为。主要失败是过早披露:用户在被询问之前就把信息给出去。这种行为对任务奖励几乎没有影响,但在成功回合里,它使智能体平均少做 1.06 次工具调用,被评测的交互变了,奖励却还在。最后,在七个代理上我们看到一条经验上的成本–忠实度前沿,使实践者可以在满足所需忠实度的前提下,选出最便宜的模拟器。
1 引言
交互式评测把基准里的“用户”变成了可执行的一部分。在 $\tau$-bench 里,一个大语言模型用户与遵循企业策略、使用工具的智能体对话(Yao et al., 2025)。$\tau^{2}$-bench 把这一点扩展到双控设置:用户也可以对共享环境采取行动(Barres et al., 2025)。双控(dual-control)指用户和智能体都能改同一份环境状态。同一模式正在进入训练:MUA-RL 把大语言模型模拟的用户放进强化学习循环(Zhao et al., 2025),更广的智能体强化学习系统则在长交互轨迹上优化(Wang et al., 2025; Luo et al., 2025)。
这造成一种容易被忽略的实验依赖。用户代理控制信息出现的时机、观察,有时还包括用户侧动作。如果它泄露信息、编造状态或提前停止,那么即使任务奖励不变,智能体也已经不是在解原先设计的那次交互。例如,某个电信域代理一开口就说:“I’m John Smith, by the way. My number is 555-123-2002.” 此时智能体还没有问这两个字段,任务本来要考察的信息收集步骤被拿掉了。
近期工作表明,大语言模型用户不同于真实人类,模拟器的选择会改变测到的助手表现(Dou et al., 2025; Seshadri et al., 2026; Zhou et al., 2026)。专门训练的用户模型,比“被提示去扮演用户的助手模型”更像人(Naous et al., 2026; Wu et al., 2026)。我们问一个互补的问题:给定基准自己写明的用户规格,代理有没有正确执行这个角色?我们把这称为功能忠实度。它衡量的是对合同的遵守,不是像不像真人。
我们有三项贡献。第一,提出 UserProxyBench,一层盖在 $\tau$ 任务上的评测,把用户和智能体分开打分。第二,表明任务奖励并不能覆盖用户忠实度:近四分之一的成功轨迹含有违反用户合同的行为,而最常见的失败几乎从智能体奖励里看不见。第三,把用户代理的选择看成明确的运行权衡,用 UFS 作为可靠性约束,在给定评测或训练流水线里最小化用户侧推理成本。
2 UserProxyBench
#### 用户忠实度分数
每道任务提供一份私有用户蓝图(人设、已知与未知信息、目标和任务专用指令)、常设的模拟器指南,以及在部分域里的用户工具。设 $C_{i}=\{c_{i1},\ldots,c_{im}\}$ 为回合 $i$ 适用的标准集合。我们定义
$$f_{i}=\prod_{j=1}^{m}\mathbf{1}\!\left\{c_{ij}\ \text{passes}\right\},\qquad\mathrm{UFS}=\frac{1}{N}\sum_{i=1}^{N}f_{i}.\tag{1}$$
因此 UFS 是这样的回合所占比例:代理满足自己合同里每一条适用标准。电信域另有一项不依赖评判模型的用户动作探针,因为那里存在金标准用户写操作;它不并入 UFS,因为其他域没有同一信号。
#### 与任务绑定的评分标准
Claude Opus 4.8 根据私有蓝图、模拟器指南原文、用户工具界面和一段样例交互,为每道任务写 4–8 条原子标准。样例只用来识别可能出现的情形;正确性仍以蓝图和指南为准。每条标准必须引用一段逐字的依据原文,必须能在轨迹上被证伪,并且只涉及用户。一个独立核验器(GPT-5.6-Sol,与生成器不是同一个模型)在打分前检查每一组任务级标准的依据、可达成性、冗余和范围。然后由 Claude Opus 4.8 给候选轨迹评分,评分时看不到代理身份;生成器和评分器是同一个模型,这一限制我们在第 4 节再谈。最终集合有 2,141 条标准:电信 634、航空 296、零售 656、银行 555(每道任务 5.7 条),分属四类:有依据、过早披露、目标偏离和遗漏信息。这延续了用实例专用标准做开放式评测和构造奖励的做法(Arora et al., 2025; Gunjal et al., 2026),但对象是用户侧的环境组件,而不是助手的回答。
占主导的那一类,来自展示给每一个代理的一条明确指令:“Disclose information progressively. Wait for the agent to ask for specific information before providing it.”(逐步披露信息。等智能体询问具体信息之后再提供。)类似的明确规则禁止编造不可得的信息,要求工具结果有依据,并要求一直继续到任务目标被满足。因此我们打的是写明的合同遵守,而不是一种隐含的文风偏好。
#### 设置
我们在四个企业域的完整基础划分上评测七个被报告的代理:电信(114 道)、航空(50)、零售(114)和银行知识(97),合计 375 道任务。GPT-5.5 被冻结为智能体;只更换用户代理。被报告的集合含三个开源权重模型和四个托管模型。每道任务、每个代理一次 rollout。我们把基准在智能体侧的任务奖励记为 $R_{\tau}$,以便和 $\tau$ 基准家族区分。托管成本使用用户侧账单花费;自托管模型则把测到的输入/输出 token,按 2026 年 8 月查阅的公开无服务器价格换算(Together AI, 2026)。
3 结果
3.1 在忠实度约束下选择代理
忠实度一旦可测,运行上的问题就是:哪一个模拟器是满足流水线可靠性要求的最便宜选择。对所需忠实度 $q$,
$$U^{*}(q)=\argmin_{U}C(U)\quad\text{s.t.}\quad\mathrm{UFS}(U)\geq q,\tag{2}$$
其中 $C(U)$ 是用户侧推理成本。图 1 给出前沿。在 $q=.84$ 时,Gemma-31B 是满足条件的最低成本代理:UFS 为 .845,每次模拟约 0.0175 美元。Gemini-3.5-Flash 的 UFS 高 1.9 分,但成本是 3.2 倍;把要求提高到 $q=.86$,运行点移到 Gemini;在 $q=.75$ 时,GPT-4.1-mini 更便宜。三个被测代理被严格支配,因为另有模型既更便宜又更忠实。在 1,000 条提示、每条 64 次 rollout 时,Gemma-31B 的用户侧推理大约每个 epoch 1.1k 美元,Gemini-3.5-Flash 约为 3.6k 美元。
图 1:成本–忠实度前沿。每个点是一个用户代理;智能体冻结为 GPT-5.5。虚线是有效前沿(没有代理同时更便宜且 UFS 更高)。带圈的点被严格支配。因为横轴是对数成本,满足所需 UFS $q$ 的最便宜代理会随 $q$ 改变:在 $q=.84$ 时是 Gemma-31B,在 $q=.86$ 时是 Gemini-3.5-Flash。
3.2 用户代理会改变基准结果
被评测的智能体在各代理条件下没有任何变化,但平均 $R_{\tau}$ 从 .644 到 .796。去掉银行域(其绝对奖励一律偏低)后,分域跨度从 .132 到 .298,航空达到 .280,零售达到 .298。图 2 把实验控制写清楚:同一行上的每个点,都是同一个 GPT-5.5 智能体、同一个域,只换了被模拟的用户。
图 2:只更换了用户模拟器。每个点是七个用户代理之一;灰色条表示同一冻结的 GPT-5.5 智能体在一个域内被诱导出的 $R_{\tau}$ 范围。
在全部 2,618 条被评分的轨迹中(2,625 条里:两次运行遇到基础设施错误,五条因为没有适用标准而无法评分,见附录 B),智能体成功的回合里有 24.4% 未通过 UFS;在电信域,全部轨迹中有 39.7% 是 $R_{\tau}$ 通过、UFS 失败。
3.3 为什么任务奖励筛不出用户代理
在每个“代理–域”格子里,我们比较某一失败族出现时与不出现时的智能体通过率(两侧至少各五次回合)。目标偏离不常见(134 次失败),平均把通过率降低 .515。过早披露是主导失败(480 次),但平均只把通过率改变 $-.043$;其中位数效应为正($+.033$),符号在各格子间也不一致。图 3 同时给出每一族的频率,以及它对智能体奖励的影响:最常见的失败,正是 $R_{\tau}$ 最难发现的那一种。
图 3:$R_{\tau}$ 对主导失败几乎是盲的。左:各失败族在全部代理上出现的频率。右:该族出现与不出现时智能体通过率的变化,每个点是一个两侧都至少有五次回合的“代理–域”格子(最多 28 个格子)。目标偏离让智能体损失 $-.52$;过早披露是最常见的失败,损失为 $-.04$。
这一点在能力较强的模型上也看得见。在电信域,Sonnet-4-6 和 GPT-4.1-mini 给冻结智能体的 $R_{\tau}$ 同为 .947,但它们的 UFS 分别是 .474 和 .737。差距不只是披露:在另一次成功的电信回合里,Gemma-26B 说自己正在关掉飞行模式,但并没有对应的用户工具调用,设备仍处于飞行模式(附录 C)。
去掉披露类标准会大幅重排模型:Qwen3.6-35B 从第六升到第三,Gemma-26B 从第四落到最后,只看披露的 UFS 与不含披露的 UFS 几乎不相关($\rho=.071$)。因此 UFS 最好和它的失败剖面一起读。
3.4 对多轮强化学习的含义
对训练来说,问题不只是最终奖励变不变,而是被强化的那条轨迹变不变。限制在成功回合($R_{\tau}=1$)上,过度披露的用户使冻结智能体少发出 1.06 次工具调用、少问 0.26 个问题,七个代理上都一致。智能体收到相同的任务奖励,信息收集却更少。
在全部七个代理都完成的同一批 374 道任务上,智能体平均回合数与 UFS 的相关为 $r=.955$,与 $R_{\tau}$ 的相关为 $r=.594$(附录 E);代理的选择使平均回合数变化 26%,问题数变化 25%。在多轮强化学习里,忠实度决定 rollout 是否实现了所要的交互,成本决定预算里能放进多少这样的 rollout。因此第 3.1 节的运行规则是:选择满足所需忠实度的最低成本代理。
4 讨论
UserProxyBench 测量的是合同忠实度,不是真人真实度;二者互补。UFS 由生成评分标准的那个模型来评判,我们的人工抽查(十道任务,外加 50 条标准/判定)只有一名评分者。一项不依赖评判模型的电信探针,在 658 条轨迹里发现 54 次错过的金标准写操作;其中 23 条仍通过了每一条适用标准,20 条通过了一条直接相关的标准。限制包括:每道任务只有一次 rollout、服务价格随时间变化、银行域版本被钉死,以及没有测量下游被训练策略的效果。
参考文献
- Arora et al. (2025) Rahul K. Arora, Jason Wei, Rebecca Soskin Hicks, Preston Bowman, Joaquin Quiñonero-Candela, Foivos Tsimpourlas, Michael Sharman, Meghan Shah, Andrea Vallone, Alex Beutel, Johannes Heidecke, and Karan Singhal. HealthBench: Evaluating Large Language Models Towards Improved Human Health. arXiv:2505.08775, 2025.
- Barres et al. (2025) Victor Barres, Honghua Dong, Soham Ray, Xujie Si, and Karthik Narasimhan. $\tau^{2}$-Bench: Evaluating Conversational Agents in a Dual-Control Environment. arXiv:2506.07982, 2025. Oral at ICML 2026.
- Dou et al. (2025) Yao Dou, Michel Galley, Baolin Peng, Chris Kedzie, Weixin Cai, Alan Ritter, Chris Quirk, Wei Xu, and Jianfeng Gao. SimulatorArena: Are User Simulators Reliable Proxies for Multi-Turn Evaluation of AI Assistants? EMNLP, 2025.
- Gunjal et al. (2026) Anisha Gunjal, Anthony Wang, Elaine Lau, Vaskar Nath, Yunzhong He, Bing Liu, and Sean Hendryx. Rubrics as Rewards: Reinforcement Learning Beyond Verifiable Domains. ICLR, 2026.
- Luo et al. (2025) Xufang Luo, Yuge Zhang, Zhiyuan He, Zilong Wang, Siyun Zhao, Dongsheng Li, Luna K. Qiu, and Yuqing Yang. Agent Lightning: Train ANY AI Agents with Reinforcement Learning. arXiv:2508.03680, 2025.
- Naous et al. (2026) Tarek Naous, Philippe Laban, Wei Xu, and Jennifer Neville. Flipping the Dialogue: Training and Evaluating User Language Models. ICLR, 2026.
- Seshadri et al. (2026) Preethi Seshadri, Samuel Cahyawijaya, Ayomide Odumakinde, Sameer Singh, and Seraphina Goldfarb-Tarrant. Lost in Simulation: LLM-Simulated Users are Unreliable Proxies for Human Users in Agentic Evaluations. ACL, 2026.
- Together AI (2026) Together AI. Serverless inference pricing. https://www.together.ai/pricing, accessed August 2026.
- Wang et al. (2025) Zihan Wang, Kangrui Wang, Qineng Wang, Pingyue Zhang, Linjie Li, Zhengyuan Yang, Kefan Yu, Minh Nhat Nguyen, Licheng Liu, Eli Gottlieb, Monica Lam, Yiping Lu, Kyunghyun Cho, Jiajun Wu, Li Fei-Fei, Lijuan Wang, Yejin Choi, and Manling Li. RAGEN: Understanding Self-Evolution in LLM Agents via Multi-Turn Reinforcement Learning. arXiv:2504.20073, 2025.
- Wu et al. (2026) Shirley Wu, Evelyn Choi, Arpandeep Khatua, Zhanghan Wang, Joy He-Yueya, Tharindu Cyril Weerasooriya, Wei Wei, Diyi Yang, Jure Leskovec, and James Zou. HumanLM: Simulating Users with State Alignment Beats Response Imitation. arXiv:2603.03303, 2026.
- Yao et al. (2025) Shunyu Yao, Noah Shinn, Pedram Razavi, and Karthik Narasimhan. $\tau$-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains. ICLR, 2025.
- Zhao et al. (2025) Weikang Zhao, Xili Wang, Chengdi Ma, Lingbin Kong, Zhaohua Yang, Mingxiang Tuo, Xiaowei Shi, Yitao Zhai, and Xunliang Cai. MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for Agentic Tool Use. arXiv:2508.18669, 2025.
- Zhou et al. (2026) Xuhui Zhou, Weiwei Sun, Qianou Ma, Yiqing Xie, Jiarui Liu, Weihua Du, Sean Welleck, Yiming Yang, Graham Neubig, Sherry Tongshuang Wu, and Maarten Sap. Mind the Sim2Real Gap in User Simulation for Agentic Tasks. In Conference on Language Modeling (COLM), 2026.
附录 A 全部代理结果
| 代理 | 托管方式 | 每次模拟成本 | 智能体 $R_{\tau}$ | 平均 UFS | 提示 token | 补全 token |
|---|---|---|---|---|---|---|
| Sonnet-4-6† | 托管 | .1841 | .784 | .778 | 57,888 | 665 |
| Gemini-3.5-Flash | 托管 | .0558 | .796 | .864 | 53,111 | 2,026 |
| Qwen3.6-35B† | 开源权重 | .0249 | .779 | .612 | 47,590 | 7,524 |
| Gemma-31B | 开源权重 | .0175 | .737 | .845 | 43,696 | 461 |
| Gemma-26B | 开源权重 | .0147 | .720 | .759 | 36,411 | 562 |
| GPT-5.4-mini† | 托管 | .0144 | .644 | .599 | 26,050 | 1,587 |
| GPT-4.1-mini | 托管 | .0063 | .720 | .752 | 29,574 | 449 |
表 1:代理汇总结果,按用户侧成本排序。智能体 $R_{\tau}$ 和平均 UFS 是冻结的 GPT-5.5 智能体在每个代理下、四个域上的未加权均值。†在成本–UFS 平面上被严格支配。
附录 B 分域的 $R_{\tau}$ 与 UFS
| 代理 | 电信 $R_{\tau}$ | 电信 UFS | 航空 $R_{\tau}$ | 航空 UFS | 零售 $R_{\tau}$ | 零售 UFS | 银行 $R_{\tau}$ | 银行 UFS |
|---|---|---|---|---|---|---|---|---|
| Sonnet-4-6 | .947 | .474 | .880 | .840 | .851 | .912† | .458 | .885∗ |
| Gemini-3.5-Flash | .965 | .711 | .880 | .940 | .886 | .929† | .454 | .876 |
| Qwen3.6-35B | .895 | .254 | .920 | .680 | .860 | .646† | .443 | .866 |
| Gemma-31B | .912 | .781 | .840 | .880 | .763 | .886 | .433 | .835 |
| Gemma-26B | .833 | .588 | .880 | .800 | .728 | .868 | .438 | .781∗ |
| GPT-5.4-mini | .895 | .325 | .640 | .580 | .588 | .717† | .454 | .773 |
| GPT-4.1-mini | .947 | .737 | .800 | .740 | .719 | .779† | .412 | .753 |
表 2:分域结果。电信/航空/零售/银行的 $n=114/50/114/97$,有两处例外:标 ∗ 的两个银行格子 $n=96$(一道任务出现基础设施错误);标 † 的五个零售代理 $n=113$,其中一道任务没有适用标准,UFS 无定义。2,625 条轨迹中有 2,618 条被评分。
附录 C 失败分类与例子
分类在四个族下定义 19 种模式;2,141 条保留标准用到了其中 18 种。groundedness.self_contradiction 在这组任务上得到零条标准。过早披露包含 volunteers_unasked_info、preempts_diagnosis 和 dumps_blueprint;有依据覆盖没有支撑的个人/设备状态、声称做了却未执行的动作、自相矛盾,以及编造未知信息;目标偏离覆盖过早停止、接受被禁止或不充分的结果,以及放弃目标;遗漏信息覆盖隐瞒被询问的信息,以及跳过被要求的用户动作。
#### 过早披露(Qwen3.6-35B,电信,$R_{\tau}=1$)
“I’m John Smith, by the way. My number is 555-123-2002.”
这是用户的开场回合,发生在智能体索要身份信息之前。
#### 声称做了却未执行的动作(Gemma-26B,电信,$R_{\tau}=1$)
“Okay, I’ll try that. Let me see… I’m turning off this Airplane Mode now. Just a moment… okay, I’ve waited a bit.”
没有发生 toggle_airplane_mode 调用,随后的设备状态仍显示飞行模式开启。
#### 编造的设备状态(Gemma-26B,电信)
“Let me try to send that picture one more time… Oh! It worked! The little bar finished moving and it says it was sent!”
没有工具结果证明彩信成功;上一次相关检查返回的是失败。
附录 D 评分标准的构造与不依赖评判模型的探针
Claude Opus 4.8 根据私有用户蓝图、模拟器指南、用户工具界面和一段样例对话生成标准;提示明确写明样例不是oracle。标准必须引用一段精确的依据原文,并由 GPT-5.6-Sol 按九项检查做批量审核,覆盖依据、可证伪性、范围、是否归因于用户、可达成性、分类是否合适,以及冗余。然后 Claude Opus 4.8 一次一条地给候选轨迹评分,不看代理身份。
一项不依赖评判模型的电信探针,在 658 条可评分轨迹上,把实际用户工具调用与金标准用户写断言比较。54 条轨迹错过一次金标准写操作;其中 23 条仍通过了每一条适用的语义标准,20 条有一条直接相关的标准被应用并且仍然通过。把这一机械信号加进去,每个代理的电信 UFS 会改变 .009–.070,排序不变,因此我们把它作为独立诊断来报告,而不改变跨域的 UFS 定义。
附录 E 智能体付出与代理指标
图 4 比较 UFS 和智能体任务奖励,看哪一个更能预测每个代理所诱导的交互。在全部七个代理都完成的 374 道任务上,智能体平均回合数与 UFS 的相关为 $r=.955$,与 $R_{\tau}$ 的相关为 $r=.594$。
图 4:全部七个代理都完成的 374 道任务上的智能体平均回合数,对照 UFS(左)和智能体 $R_{\tau}$(右)。点直接标出代理名称。
附录 F 限制与下一步校验
目前的人工抽查是:十道任务从头读到尾,外加 50 条最终标准/判定,由一名作者审阅。它使流水线改了两次,但不是盲法、不是分层抽样,也不是多名评分者。因此最重要的下一步校验,是对标准有效性和评判决定做盲法人类研究,并报告一致率统计。在电信域上重复 rollout、换第二个冻结智能体,以及一个小规模强化学习实验(比较在高 UFS 与低 UFS 代理上训练出的策略),可以分别检验随机性、对交互伙伴的依赖,以及下游训练效果。
附录 G 实验配置与材料
七个被报告的用户代理都使用温度 1.0。冻结的 GPT-5.5 智能体使用高推理力度。GPT-5.4-mini 也使用高推理力度;GPT-4.1-mini 没有思考模式;Gemini-3.5-Flash 使用其默认思考行为;Qwen3.6-35B-A3B 在本地服务并打开思考;Gemma-4-31B-it 和 Gemma-4-26B-A4B-it 在本地服务并关闭思考;Sonnet-4-6 没有使用扩展思考,因为轨迹运行器没有转发该提供方专用参数。本地 Gemma/Qwen 推理在两名 worker 上使用张量并行(Gemma-4-26B-A4B-it 和 Qwen 还使用了专家并行)。
评分标准由 Claude Opus 4.8 生成(温度 1.0),由 GPT-5.6-Sol 独立核验,再由 Claude Opus 4.8 评分。因此生成器和评判器是同一个模型。我们把 Opus-4-8 和 GPT-5.5 排除在被报告的代理集合之外,因为它们的对话或输出参与了标准构造;GPT-5.5 在全部运行里仍是冻结的智能体。基准建在 sierra-research/tau2-bench v1.0.0、提交 8ebb749(MIT 许可证)之上,另有两处本地工程补丁,用于评判路由和上下文溢出时的检索。数值表和图由已评分的轨迹文件确定性地重新生成。
附录 H 更广的影响
更可靠的用户代理,可以使交互式基准和强化学习环境更容易审计、更便宜地运行。主要风险是把合同忠实度过度解释成真人真实度:一个高 UFS 的模拟器,仍可能低估真实用户、方言、无障碍需求或对抗行为。因此 UFS 应当补充、而不是取代与真实用户一起做的评测,以及按人群敏感的模拟指标。成本前沿的结果随时间变化,不应被当成长期有效的商业建议。
出处:Ashish Jain, Armaan Sandhu,UserProxyBench: Evaluating LLM User Simulators for Agent Benchmarks and Training,2026-09-29,https://arxiv.org/abs/2609.38043,CC BY 4.0。
觉得有用,转给同事
微信扫码
用微信扫一扫,在手机上打开后即可转发。