CodexQA

行业与实践研究与基准测试

τ³-Bench:把智能体基准评测推进到知识与语音

CodexQA 团队阅读约 6 分钟

Sierra 发布 τ³-Bench。知识任务上,最好的前沿模型只完成约 25%;即便给到正确文档,也只有 40%。现实噪声和打断下,语音完成率落到 26%–38%。

本文目录

𝜏³-Bench:把智能体基准评测推进到知识与语音

Victor Barres、Ben Shi、Ola Zytek、Soham Ray、Keshav Dhandhania、Pedram Razavi

2026 年 3 月 18 日

自 2024 年 6 月发布以来,𝜏-Bench 已成为研究人员、模型构建者和使用 AI 的企业事实上的标准。它测试的是一件容易演示、却很难度量的事:一个模型能否可靠地帮助某人把一项任务从头做到尾。

今天,我们发布 𝜏³-Bench,从几个重要方面扩展这一基准:

  • 𝜏-Knowledge 测试智能体能否在散布于不同系统和格式中的大量公司内部文档上工作;
  • 𝜏-Voice 评测为实时语音对话而构建的智能体;以及
  • 我们还纳入了 𝜏-Bench 社区对现有 𝜏-Bench 领域贡献的修复,以提高评测准确性。

这些扩展由我们在 Sierra 构建和部署智能体的经验所塑造,指向我们所见的下一处前沿,并给社区一条共同的途径,用来对照这些前沿度量进展。

𝜏-Knowledge:在凌乱且不断变化的知识库上评测智能体

大多数智能体基准把模型需要的一切事先交到它手上。但在真实世界里,智能体要在许多不同的公司文档之间穿行才能成功:内部政策手册、产品目录和标准作业程序。这些信息是非结构化的、不断变化的、散布在多个来源之中的,并且充满内部行话——这使得简单搜索不可靠。

用户报告钱包被盗并要求冻结卡片,请求经过 τ-Knowledge 的知识库与工具调用,智能体确认注销卡片并发放临时贷记

一次用户请求就可能要求智能体在数百篇知识文章里找到正确政策,然后执行正确顺序的工具调用来解决它。

为了测试这一点,𝜏-Knowledge 引入 𝜏-Banking,一个受金融科技启发的客户支持领域,围绕一个现实的知识库构建:698 篇文档,分布在 21 个产品类别中(约 195K token)。任务要求智能体搜索这个语料、对找到的内容进行推理,并执行多步工具调用——常常要识别只在文档里被提到、而没有被明确列出的工具。例如,处理一笔有争议的交易,可能要求智能体跨多篇文档定位正确的争议政策,推断适当的临时贷记流程,冻结卡片,开启争议,并发放一笔临时贷记——而且全部要按正确顺序。

𝜏-Knowledge 不假定只有一种查找信息的方法。它支持关键词搜索、基于嵌入的检索、把知识库的大部分直接提供给模型的长上下文做法,甚至通过终端式命令直接探索文件。这使得它能评测新的检索方法,而不只是标准的语义搜索。任务成功与否,依据的是对模拟后端数据库是否做了正确更新——例如争议是否被开启、卡片是否被冻结,或贷记是否被发放——而不是对话听起来有多精致或多有说服力。

两张柱状图。第一张按 τ-Bench 领域给出通过率,τ-banking 明显更低,为 25.5。第二张按检索方法给出平均通过率,Terminal 为 20.1。

结果令人瞩目。最好的前沿模型——带有高推理设置的 GPT-5.2——在大约 25% 的任务上成功。即使我们提供完成任务所需的精确文档,表现也只升到 40%。这表明瓶颈不只是找到正确信息——而是理解它、得出正确结论,并执行所要求的动作。

我们还看到,取决于知识库如何被访问,存在有意义的差异。当模型被给予对知识库灵活、自由形式的访问(例如经由终端)时,表现好于被限制在传统语义搜索之时。但这种额外的灵活性是有代价的:当使用更结构化的检索方法时,智能体可以显著更快地回应。

当我们查看可靠性和效率时,这些模式甚至更清楚地显现。有些模型达到相近的准确率,但花费的时间是九倍;而另一些总体得分更低的模型,在重复试验中却一致得多。在面向人的部署里,这种效率差距很重要:需要更多轮次、更多次搜索和更多次工具调用的智能体,不仅成本更高,也会让用户觉得更慢、更不值得信任。

论文 | 排行榜 | Tau-Knowledge 报告

𝜏-Voice:在现实语音条件下评测智能体

语音正迅速成为我们与智能体交互的默认方式,但自然对话带来的挑战与基于文本的聊天完全不同。你会打断。你会在对方还在说话时说 “uh-huh”。你会在句子说到一半时改变主意。

真实对话是全双工的——双方同时说和听——而且它是凌乱的。语音智能体需要在处理这一切的同时仍然完成真实任务:查询订单、更新账户、预订航班。今天的基准把这些技能孤立地测试。没有一个度量语音智能体能否在现实条件下同时做到这两件事。

𝜏-Voice 把 𝜏-Bench 扩展到带有复杂话轮转换动态的实时语音交互。它模拟的不是安静房间里的干净音频,而是智能体实际会接到的那种电话:一个带口音的用户从嘈杂的咖啡店打来,连接不稳定,经过压缩的电话线路。失败是可预料的,但很难修。用户逐个字母拼出一个确认码,智能体听错一个字母——认证失败。用户说 “yes” 来确认一次取消,但这声被背景噪声淹没了,于是智能体再问一次,又再问一次。网络下跌在句子中途丢掉几帧,智能体把其余部分幻觉出来。

话轮转换是挑战的另一半。我们的模拟用户并不被动地等智能体说完。他们在听够了的时候插进来,并在智能体犹豫时往前推——这些都由可配置参数控制:来电者有多耐心、多爱打断,或多么不能忍受沉默。

多图界面,展示用户与智能体之间的语音活动、音频处理以及对话话轮转换

上图展示了单次通话中现实对话条件的一个子集。主时间线捕捉六分钟重叠的语音、打断和噪声。插图 A 分解智能体实际收到的音频——干净语音与街道噪声、突发声响和非指向性话语混合在一起。插图 B 放大话轮转换:智能体必须决定忽略什么,以及何时让出话轮。

我们对三家紧密匹配的语音提供方做了基准测试——OpenAI Realtime、Google Gemini Live 和 xAI Grok Voice。标题上的对比,是非推理文本模型相对于现实条件下的语音智能体:在理想条件(没有打断或音频效应)下,最好的语音智能体接近非推理文本模型(约 54% 对干净语音的 31–51%),但一旦你引入现实音频和话轮转换,差距就大幅变宽(约 54% 对现实语音的 26–38%)。带推理的文本智能体达到约 85%,而弥合这一差距将需要这样的智能体:它们能在维持一场流畅对话的同时,把多步任务推理完,而不只是在回复之前想得更久。

柱状图比较文本模型与语音模型的任务完成率(pass@1)。文本模型达到 85% 和 54%,显著高于语音模型;语音模型从 26%(现实条件)到 51%(干净条件)。

即便在理想条件下,语音智能体也落后于文本。一旦引入真实世界的音频条件,这一差距就大幅变宽。

事情是在哪里出的错?失败模式在各提供方之间是一致的:认证是瓶颈——一旦智能体听错一个名字或一封电子邮件,下游的一切都会失败。除了转写之外,智能体还会跟丢多步请求,完成任务的一部分却忘掉其余部分,或者从反复的失败中再也恢复不过来。

我们发布 𝜏-Voice,不只是作为一个基准,而是作为一个评测语音智能体的平台——因为实验室条件与真实来电之间的差距,正是最难的问题所在之处。

论文 | 排行榜 | 示例

加固核心 𝜏-Bench 领域

在新领域之外,我们纳入了一大批由社区推动的修复,针对原来的 𝜏-Bench 航空、零售和电信任务。这些修订中有许多直接来自外部审计——尤其是来自 Amazon 的 𝜏²-Bench Verified 努力——以及社区拉取请求,其中包括若干来自 Anthropic 的请求。这些更新解决不正确的期望动作和歧义,并收紧评测标准,以便更好地反映真实的政策与系统行为。更多内容见详细说明。

与今天智能体的现实相匹配的评测基准

随着智能体成为客户体验中每天都会遇到的一部分,基准必须度量的不只是干净的演示。𝜏³-Bench 在智能体最可能出故障的真实世界条件下测试它们——不只是为了暴露它们的缺陷,而是为了帮助社区构建具有真实世界可靠性的智能体。

觉得有用,转给同事

微信扫码

用微信扫一扫,在手机上打开后即可转发。

用 RSS 订阅

提交勘误