τ - bench 如何 把 「做成 一次」 和 「每次 都能 做成」 拆开
Sierra 的 τ-bench 从 2024 年 6 月起测工具、Agent 和用户的多轮交互,并用重复成功率暴露一次通过掩盖的不稳定。它后来成为研究和行业评测的参照。

来源:Sierra 博客《How τ-bench is shaping the development and evaluation of agents》。基准本身于 2024 年 6 月发布,论文见 https://arxiv.org/abs/2406.12045 ,代码在 sierra-research/tau-bench。
一次通过不够
τ-bench(tool-agent-user benchmark)测的是 Agent 在真实约束下把事情做完的可靠性。和传统基准不同,它不只问能不能做成一次,而问同一件事重复多次是否还能做成。
早期结果:即便基于 GPT-4 的当时先进 Agent,任务成功率也不到 50%;同一任务重复八次时,成功率大约只有 25%。一次评测会把推理、工具使用和稳定性上的弱点盖住,重复成功率把它们露出来。
一个典型场景是航空改签。用户要把机票改到另一个目的地机场。Agent 必须在对话里把必要信息问全,对照航司政策,用预订接口查找并在规则允许时改订。轨迹里说「已改好」不算数,环境里的订单状态才算数。
研究侧把它当成参照,也指出它窄
不到一年,τ-bench 被当成更接近真实的多轮 Agent 基准来引用,并带出领域基准。
MedAgentBench 明确把它当作通用 Agent 评测的样板,同时指出医疗没有同等的标准环境,于是做了带 FHIR 接口和数据库的电子病历场景,题目由医生撰写。LAM Simulator(ICLR 2025,匿名)肯定它的多轮工具使用,但指出当时只覆盖零售和航空两个领域,因此去做规模更大、领域更多、带连续反馈的环境。伯克利关于大模型训练的一份综述把它列为检验真实工具使用和用户交互的新基准。和 SWE-Bench 一类编程基准并列时,它代表的是多步推理加遵守规则,而不是单轮问答。
行业侧在用它选模型
博客后半写的是实验室和初创公司用 τ-bench 衡量更接近上线的表现,而不只留在论文里。Anthropic 等实验室在模型发布里采用或对照这类多轮、有状态的任务,是这条线从学术基准变成发布指标的原因之一。
对自建评测,可直接拿走的不是航空领域本身,而是两个设计:成功定义在环境状态上;报告重复次数下的成功率,而不是只报 pass@1。一次做成、八次只成两次的 Agent,不适合放进会改订单的流程。
原文:https://sierra.ai/blog/tau-bench-shaping-development-evaluation-agents
觉得有用,转给同事
微信扫码
用微信扫一扫,在手机上打开后即可转发。