实 时 语音 智能 体 评 测: 从 部件 质量 到 可 核验 的 结果
Walmart Global Tech 综述 38 份来源、41 篇 PDF,把实时语音智能体分成六类。端到端最快约 702 毫秒,级联可到 516 毫秒,但架构不是判决。评测应同时报告时序、恢复和可核验结果。

本文目录
实时语音智能体评测:从部件质量到可核验的结果
Shivam Negi(Northeastern University;Walmart)、Arpit Rawat(Northeastern University;Sinch Mailgun)、Rashi Jain(University of Texas at Dallas;Walmart)。许可证:CC BY 4.0。arXiv:2609.30798,2026 年 9 月 28 日。
摘要
实时语音智能体已经从研究原型走到生产部署,但描述它们的文献散在三个很少互相引用的社区里:语音基础模型、话轮转换的心理语言学,以及智能体评测。架构论文报告延迟,话轮论文报告预测准确率,智能体基准报告任务成功。结果是,没有一个数字能说明部署出去的智能体到底好不好。这篇综述用 38 篇一手来源补这个缺口。来源收成面向应用的六类分类。由此得出三条有证据的说法。第一,架构选择是部署约束,不是已经定案的判决:一篇 2026 年的企业教程报告,还没有完全可自托管的端到端系统满足生产约束;与此同时,分块的级联独立达到了最先进的双工行为,说明双工行为可以和双工架构分开。第二,评测已经从部件质量决定性地转向可落地的结果:近期基准核验后端状态,而不是信任智能体声称自己做了什么;现在有单个开放系统同时在时序、恢复和工具正确性上被测量,而不是只看一条轴。第三,大多数模型和基准里的双人假设正在破裂:多方话轮和多说话人推理基准表明,决定什么时候不说话,以及正确推理谁可以被告知什么,是一等能力,双人框架量不出来。对 38 个来源,本文分别写它针对的问题、机制和报告的证据,并报告检索策略、纳入标准和一次核验步骤。这次核验抓住了一个在流传中被张冠李戴的 arXiv 标识。本文最后提出 TRG(Timing–Recovery–Grounded,时序、恢复、可落地结果),一套最低报告标准:实时语音智能体要同时用时序、中断后的恢复和经状态核验的结果来刻画;多方部署再加有条件的第四轴,而不是只报最好看的那一条。
1 引言
口语交互是最老的人类界面,也是最难令人信服地自动化的界面之一。二十年来占主导的工程模式是一条流水线:语音活动检测器决定用户什么时候停嘴,自动语音识别(ASR,把声音转成文字)把音频变成文本,对话系统决定说什么,文本转语音(TTS,把文字读成声音)把回答念出来。这种拆分模块化,也好调试,今天大多数已部署系统仍靠它。它也编码了一个人类对话不断违反的假设:恰好一个人在说话,话轮之间隔着可检测的静音。
Défossez et al. [1] 把后果说得很准。流水线的复杂度带来数秒延迟;用文本当中间模态,会丢掉情绪和非语音声音这类非语言信息;把对话切成说话人话轮,无法表示重叠、打断或插话。人类对话是全双工的(full-duplex,双方可以同时听和说):参与者同时听和说,预判话轮何时结束,不等静音就开始自己的话 [2]。
三个研究社区大体平行地攻这个问题。语音基础模型问怎样从音频直接生成音频。根在心理语言学里的话轮研究问怎样预测何时该说。智能体评测问系统有没有完成用户的任务。每个都量到了真实的东西,没有一个量到整体。一个模型可以词错误率很好,仍然冻结一张它从未被授权去动的信用卡。
范围与贡献
本文论证关于实时语音智能体的三条说法,每条都对照 38 篇一手来源:15 篇来自一份种子阅读清单,20 篇通过对同一主题做系统的标题和摘要检索得到,另有 3 篇(一个全双工工具调用模型,以及两个基准扩展)是初稿之后的后续检索补上的。另外两篇只用于定位、不计入语料:一篇紧密相关的 SpeechLM 综述,一篇直接的语音到语音翻译综述,下面会讨论。第三篇关于自动综述方法的工作,单独引在文末的方法说明里。贡献是:
- 三条有证据的说法,在第 10 节论证:架构选择是部署约束而不是已定判决;评测已经从部件质量转向可落地结果,并且应当把这个转向做完;大多数模型和基准底下的双人假设正在破裂。每条说法都写上最强的支持证据和最严重的并发症。
- 写明的综述方法(第 2 节):检索策略、纳入和排除标准,以及一次程序化核验。这次核验抓住了一个流传中被张冠李戴的标识,所以上面三条说法可以追溯到核验过的来源。
- 面向应用的文献分类,分成六类(图 1),并用一张比较表(表 1)汇总。表里写每项工作的架构类别、评测轴和报告的指标。
- 从三条说法推出的报告建议:TRG(时序–恢复–可落地),一套最低标准。实时语音智能体要在时序、恢复和可落地结果上一起刻画,适用时再加多方是否得体,而不是只报最好看的那条轴。
相关综述
这不是第一篇碰到这批文献的综述,本文明确相对最近的两篇来定位。Cui et al. [3] 给出他们所称的、构建语音语言模型的方法的第一份全面概览,范围是端到端语音进、语音出模型的架构、训练配方和能力分类。Gupta et al. [4] 综述直接的语音到语音翻译,关心的是改变一句话的语言,而不是把对话维持下去。两者都不把话轮理论、对话时序或智能体工具使用评测当一等事项,也没有把级联的生产架构和端到端架构当成互相竞争的部署选择放在一起。因此本综述在模型覆盖上比 Cui et al. [3] 窄,在种类上更宽:本文把实时语音智能体当成交互系统,架构、时序和可落地评测是分不开的问题,不是三份分开的文献。
组织
第 2 节写综述方法。第 3 节给出分类。第 4 到 9 节分述每一类。第 10 节综合横切发现,第 11 节写本综述的局限,第 12 节写开放挑战。
图 1:所综述文献的分类。类别反映一项工作回答的问题——语音怎么产生、何时该说、交互是否成功——而不是发表场所或年代。颜色区分类别,并与编号重复,所以灰度下不丢信息。
2 综述方法
本文报告语料是怎么建的,以便综述可以复现、覆盖可以被评估。
候选从哪来
语料有两个来源。15 篇论文来自一份种子阅读清单。另外 20 篇用 arXiv API、按种子清单的主题做系统查询得到:语音活动投影、全双工口语对话、端到端语音到语音、神经音频编解码器、抢话和打断处理、流式文本转语音的延迟,以及点名的基准家族。候选按相关度排序,用标题和摘要筛选。逐字的查询字符串随语料发布(corpus/SEARCH_STRATEGY.md),这里不照抄。
纳入与排除
纳入的工作,其主要贡献落在实时或交互式口语上:架构、话轮模型、基准,或流式合成与编解码器。排除出现在候选里的三类材料:厂商对比文章,那是营销产物而不是可评测的研究;URL 已经打不开的来源,因为无法核验的引用不能审计;以及一份读者拿不到的未发表本地文档。检索到的条目只有在 PDF 能拿到并核验之后才保留。
核验
每份取回的 PDF 都用程序检查:PDF 结构是否有效,以及首页文字是否和记录中的那篇论文一致。这一步不是走过场。Full-Duplex-Bench-v3 一个广为流传的标识 arXiv:2602.05105 实际指向一篇无关的多智能体机器人仿真;正确标识是 arXiv:2604.04847。保留的 41 份 PDF(38 篇语料来源,加上 3 篇用于定位或方法)都通过了这项检查。
得到的语料
最终语料有 38 篇一手来源:9 篇端到端和级联架构,16 篇话轮、VAP 和对话/多说话人基准,7 篇智能体与工具使用评测,6 篇流式合成和神经编解码器。覆盖到检索日为止,并偏向 2024–2026,因为全双工文献是新近的。
3 分类
本文按每项工作回答的问题来组织文献,而不是按发表场所或日期。图 1 是由此得到的六类。这条组织轴是故意的:架构论文回答语音怎么产生,话轮论文回答系统何时该说,基准论文回答交互到底好不好。这是正交的关心点,把它们混在一起,是这个领域许多表面分歧的来源。
4 端到端语音到语音架构
这一类去掉文本这个必须经过的中间表示,直接生成语音记号,从而保留流水线丢掉的副语言信息。它为第 10.1 节提供前一半证据:放弃文本瓶颈得到什么,部署成本是什么。
Moshi
Défossez et al. [1] 把口语对话做成语音到语音的生成,而不是独立部件的流水线。从文本语言模型骨架出发,Moshi 用神经音频编解码器的残差量化器把语音生成为记号,并行建模自己的语音和用户的语音。这完全去掉显式的说话人话轮,重叠和打断可以原生表示。Moshi 是后来大多数全双工工作的参照点,并提供了若干后续论文分析的 Mimi 编解码器。
同步大语言模型
Veluri et al. [2] 把障碍说准了:预训练的大语言模型没有时间感,所以不能建模同步。作者把时间信息加进去,使模型与真实世界的时钟锁步运行,生成静音的语音单元和生成说话一样自然。这个框架比具体模型更要紧,因为它解释了:把文本大语言模型改成双工对话,并不只是推理更快的问题。
MOSS-Speech
SII OpenMOSS Team [5] 观察到,即便端到端方法通常仍保留文本中间层,他们把这刻画成根本瓶颈。他们的模型把基于模态的层拆分架构和冻结的预训练策略合在一起,保留预训练文本大语言模型的推理,同时加上原生语音能力。他们报告口语问答达到最先进水平,语音到语音的表现与有文本引导的系统相当。
OmniFlatten
Zhang et al. [6] 针对打断、附和和重叠语音,用渐进的多阶段后训练,把并行的语音流和文本流压平成一条序列,避免改动底层 GPT 模型的架构。
Hibiki-Zero
Labiausse et al. [7] 处理同声传译:模型必须决定何时听、何时说。先前系统从词级对齐数据学习这个策略;作者指出,人类口译几乎没有这种数据,必须用因语言而异的启发式去合成。Hibiki-Zero 完全去掉对齐要求,简化训练,并让语法结构不同的语言更容易扩展。
双工建模的数据
Nakata et al. [8] 处理的是供给约束,不是建模约束。训练双工模型需要说话人分开的对话音频,而自然录音把说话人混在一条通道上,所以这种数据稀缺。他们大规模构造说话人分开的全双工对话语音,对准的是否则会限制本节每种架构的数据瓶颈。
5 级联与混合流水线
级联常常被说成遗留技术。本语料里的证据不支持这种刻画,这也是本综述在实践上最要紧的发现。这些工作为第 10.1 节提供后一半证据,尤其是:双工行为可以和双工架构分开。
企业现实核对
Qiu et al. [9] 在三种配置下评测 Qwen3-Omni,这是当时最接近的、可自托管的端到端候选。仅云端的 Realtime API 达到大约 702 毫秒的音频到音频延迟,但不能自托管;本地 vLLM 部署只支持从音频生成文本(516 毫秒),不支持音频合成;本地 Transformers 部署跑完整流水线大约要 146 秒,他们称之为对实时来说太慢。结论直白,而且有证据:级联的流式流水线仍是自托管实时智能体的实用架构。他们自己的级联在完整函数调用下达到 755 毫秒的首包音频时间(time-to-first-audio)。
DuplexCascade
Yang et al. [10] 拆掉这个表面上的二分。传统级联是半双工的,因为语音活动检测(VAD,判断有没有人在说话)的切分迫使按整句轮流;他们的系统把长话轮变成按块的微话轮,并引入对话控制记号,不靠 VAD 来调节话轮。只用 5 万段多轮文本对话和轻量的 LoRA 适配(LoRA,低秩适配,只训练一小部分新增权重),他们在 Full-Duplex-Bench 上报告最先进的全双工话轮,同时在 VoiceBench 上保持强的对话智能。值得注意的是,只做文本适配避免了跨模态对齐问题——这里的双工行为是控制策略的性质,不是端到端音频建模的性质。
LTS-VoiceAgent
Zou et al. [11] 指出,串行级联不像人类对话:听者在说话者说完之前就开始想。他们的 Listen-Think-Speak 框架用语义触发和增量推理,让思考和聆听重叠,用调度而不是换模型来打延迟。
6 话轮与语音活动投影
这条线问何时该说,是语料里方法上最成熟的一类。它重要两次:它确立话轮是可以单独学习的目标,支持第 10.1 节的可分离论证;它近期的多方扩展,是第 10.3 节的双人假设第一次明显吃紧的地方。
VAP 目标
Ekstedt and Skantze [12] 把语音活动投影(VAP,Voice Activity Projection,预测双方未来的语音活动)定义成一般的自监督目标:预测两位对话者未来的联合语音活动。监督来自音频本身,不需要标注过的话轮数据。作者指出先前方法的一个理论弱点:把投影窗口里的事件独立建模,并主张建模它们的依赖。他们用话轮转换和附和预测的零样本任务来评测。
扩展
四项后续研究在 VAP 目标里分离具体因素,而不是提出新架构,合在一起说明基础模型实际依赖什么。Ekstedt and Skantze [13] 问 VAP 的预测力有多少专门来自韵律,而不是一般的声学内容,并用受控消融分离它的贡献。Inoue et al. [14] 测试在一种语言上训练的话轮目标能否转到其他语言,因为只在英语里有效的模型对全球产品用处有限。Inoue et al. [15] 缩小离线评测和部署之间的差距,演示实时连续预测,而不是在录好的语料上事后打分;这是把 VAP 用进现场系统的前提。Saga and Pelachaud [16] 用多模态编码器替换只看声学的编码器,测试视觉或其他非音频信号能否把投影准确率提高到只靠音频之上。合起来读,这四篇沿着对部署要紧的轴系统地加压测试最初的 VAP 目标:信号来源、语言、延迟和模态。
超出双人
Elmers et al. [17] 观察到传统研究压倒性地是双人的,并把 VAP 扩到三方对话。Qi and Skantze [18] 直接对准部署约束:现有多方模型假设麦克风阵列或多相机机位,人机交互场合很少有。MuVAP 把声学预测建立在单相机的人脸轨迹和单声道音频上,并引入角色相对投影(Role-Relative Projection),把任意 $N$ 个说话人的交互映射到固定的“当前持有话轮者对下一持有者”状态,避免组合爆炸。因为现有音视频语料含有剪辑切口,会破坏因果跟踪,作者贡献了 31 小时未经剪辑的单相机对话语料——提醒基准里的产物可以悄悄作废一条建模假设。
传感器增强
Hamanaka et al. [19] 指出基于相机的线索会随摆放和光照变差。他们改用耳戴设备捕捉头部运动,给出不依赖相机的话轮预测信号。
7 对话基准
这些基准是第 10.2 节所说转向能被看成一条轨迹、而不是单个结果的地方。按顺序读,它们从给系统说了什么打分,转向测试它在真实对话所施加的条件下如何行为:重叠、打断、多轮,以及不止一个说话人。因此本文大致按它们容纳了多少这种对话现实来排列。
VoiceBench
Chen et al. [20] 观察到先前评测集中在 ASR 准确率,或用高质量 TTS 合成的口语问答上,这和真实部署条件是断开的。VoiceBench 引入多方面评测,同时用真实和合成的口语指令,覆盖说话人特征、环境变化和内容因素。
Full-Duplex-Bench 家族
Lin et al. [21] 对准的是交互行为而不是话轮级输出质量,用自动指标评测停顿处理、附和、平滑话轮和用户打断,以便复现。这个家族的演进本身就有信息:v1.5 [22] 处理重叠,v2 [23] 用自动主考加入多轮评测。Zhang et al. [24] 把这条线再推进一步,认为即便 v2 的多轮评测仍把问题说得不够:全双工对话没有自然的话轮边界可切,模型质量会在对话特征、对话质量、指令遵循和安全上不均匀地变差,随着对话变长。他们的基准把连续的全双工音频切成离散话轮来打分,并发现当前全双工模型难以在多轮和多个评测维度上同时保持一致表现。这个家族的每一版都量到了前一版看不见的东西。
多说话人交互
Xiong et al. [25] 把评测推出双人假设,方向和 MP-Bench 不同:不是问智能体该不该说,而是测试它能否正确推理谁说了什么、对谁说、带着什么权限。基准里的示例场景有启发——家长私下让家用语音智能体订一份惊喜礼物,几分钟后孩子问包裹是什么。流利作答的智能体仍然失败了,尽管完全听得懂,因为它既没保住指令的来源,也没保住被保护的人,也没保住什么可以披露的边界。基准有 1,152 个测试用例,覆盖多说话人记忆、指令遵循和推理,普通话和英语平分,并表明流利的语音理解并不意味着关于谁在说话的正确社会推理。
FLEXI 与 MP-Bench
Ge et al. [26] 加上别人省略的情景:紧急情况下由模型打断,正确行为是智能体打断用户。他们报告开源模型和商业模型在紧急意识、话轮终止和延迟上有显著差距。Shih et al. [27] 处理大多数基准底下的双人假设,评测智能体作为若干参与者之一是否行为得体,包括到底要不要说话。
8 智能体与工具使用评测
这是语料里最新、动得最快的一类,它改写了评测的含义。它承载第 10.2 节的核心证据:这些基准不再信任智能体对自己行为的叙述,开始检查后果。
可落地的任务完成
Ray et al. [28] 指出现有评测把对话动态和任务完成分开处理,并在需要多轮导航、带有真实世界复杂度的可落地任务上评测智能体。
对照状态核验
Meyer et al. [29] 做出语料里最锋利的方法贡献。他们的基准度量收口率(containment,自动系统不用转人工就解决的通话比例)。100 个情景各自播种一个 PostgreSQL 后端和一个有私人目标的模拟来电者;大约三分之一施加对抗压力。关键是,评分器对照完整痕迹评估二元断言,痕迹包括工具调用、参数和返回的行。这抓住声称改了卡却没更新数据库的智能体,也同样抓住做了正确数据库修改、却泄露受保护信息的智能体。自报的成功不再被信任。
不流利与恢复
Lin et al. [30] 在真实世界的不流利下评测工具使用。不流利是自然语音里的犹豫和自我修正,干净的基准音频把它省掉了。Salimi et al. [31] 问打断之后发生什么:智能体是否从正确的流程步骤恢复,是否处理插话,是否避免重复内容。他们在 10 个企业领域上评测 27 种音频语言模型配置,报告闭源权重模型随着对话变长,变差大约慢 $3.3\times$,并且没有音频相对文本的模态差距,而开源权重模型在三条轴上都掉队。一项人类研究验证了大语言模型评判器,跨基准分析表明恢复质量大体上是一条独立的能力轴。
一个收敛的系统
NVIDIA [32] 说明这种收敛在实践里为什么要紧:他们造了一个开放模型,正好在这一族基准上被评测。系统包含流式语音编码器、仅解码器的语言模型、用于智能体文本和结构化函数调用的并行输出流,以及流式 TTS 解码器。在 Full-Duplex-Bench 1.0 上,它在所测开源权重系统里,停顿期间的错误抢话率最低(用户只是停顿时它很少抢话轮),同时在真正的用户打断之后正确接手率为 100%;在 v1.5 上,它在 93% 的情形里于附和之后恢复;在 FDB-v3 上,工具选择的 $F_{1}$ 达到 82.5%,同时指出参数准确率和端到端工具执行仍然更弱。这一组结果是语料里最清楚的证据:双工时序、对话恢复和工具调用正确性,现在被当成一个问题来测量、也来追求,而不是三个问题。
把决策者隔出来
Mishra et al. [33] 指出端到端基准把识别错误和推理错误混进一个数字,而大语言模型基准把模型隔开了,却忽略是什么让电话难打。他们的基准对准级联内部的语言模型,条件是转写噪声和被切开的语句。
不只是测量,还要训练
Fan et al. [34] 观察到语音智能体通常在文本里训练,却必须在语音里运行。他们的音频原生环境让两个全模态模型用原生音频对话,没有外部 ASR 或 TTS,环路保持可微。诊断很准:语音引入的失败是感知上的,不是推理缺陷——智能体选对了工具和参数槽,然后用从波形里听错的值填进去,这一个错误级联成失败的通话和浪费掉的步数预算。只看结果的 GRPO(group relative policy optimisation,按一组采样的相对好坏来更新策略)梯度饥饿,因为几乎每次采样都以同样方式失败;按每次成功的工具调用给分的逐轮过程奖励,把方差恢复回来。
9 流式合成与神经编解码器
合成是第 10.4 节时序轴真正被决定的地方:无论对话策略决定什么,用户感到的延迟取决于音频何时开始、以及能不能跟上。这些工作也提供最清楚的证据:一个平均数字会藏起用户注意到的失败。
把响应性当成一等指标
Dinh et al. [35] 认为,响应性受到的关注远少于感知质量,尽管它对实时助手至关重要。他们的开放基准在 13 个开源 TTS 模型上统一延迟分布、尾部延迟和可懂度,输入从单词到句子长度,以抓住典型情况和最坏情况。报告尾部延迟而不是均值,是方法上要紧的选择,因为用户经历的是最坏情况。
流式合成
四个系统从合成流水线的不同位置打同一个延迟问题。Dekel et al. [36] 把起跑线前移:不是等文本回答完整再合成音频,而是在语言模型还在出文本时就开始生成语音,让传统上串行的两个阶段重叠。Dang et al. [37] 改打解码环本身,在离散音频码上做自回归建模,以低延迟产生零样本语音,不需要针对说话人的微调。Liu et al. [38] 对准自回归 TTS 必须隐含解决的对齐问题,在双流架构里用 CTC 对齐,使文本流和语音流可以同时前进,而不是互相等待。Casanova et al. [39] 处理另一种失败:连续对话智能体需要在长会话里不退化的合成,他们的模型对准的是这种设定下持续的低延迟生成,而不是单句基准。合起来,这四个系统表明流式合成的延迟不是一个问题,而是四个:合成何时开始,解码如何进行,文本和音频如何对齐,以及整段对话里性能是否守得住。
编解码器编码了什么
Saloev et al. [40] 检查 Mimi 的 2048 记号语义码本。Mimi 是 Moshi 底下的编解码器。他们指出实时约束促使帧率受限(80 毫秒一帧),并问这个领域大体跳过的问题:学到的音频记号是否按语言学上有意义的方式划分信号?他们报告标准的 ABX 评测抓不住表示的某些方面。这要紧,因为第 4 节的每个端到端系统都继承它的编解码器保留或丢弃的东西。
表 1:所综述的实时语音智能体研究摘要,按类别组织,写明架构类别、主要评测轴,以及每项工作报告的指标或证据。条目对应随附语料里的 PDF。
| 类别 | 工作 | 架构 | 评测轴 | 报告的指标或证据 |
|---|---|---|---|---|
| 端到端语音到语音 | Moshi [1] | 语音–文本基础模型 | 全双工对话 | 自己/用户并行流;编解码器记号生成 |
| Synchronous LLMs [2] | 有时间感的大语言模型 | 同步 | 与真实世界时钟锁步生成 | |
| MOSS-Speech [5] | 层拆分、冻结预训练 | 无文本的语音到语音 | 口语问答最先进;语音到语音与文本引导相当 | |
| OmniFlatten [6] | 压平的 GPT | 重叠、附和 | 渐进多阶段后训练 | |
| Hibiki-Zero [7] | 仅解码器 | 同声传译 | 去掉词级对齐要求 | |
| DuplexChat [8] | 数据构造 | 训练数据供给 | 大规模说话人分开的双工语音 | |
| 级联 / 混合 | Enterprise Tutorial [9] | 流式级联 | 自托管延迟 | 755 ms 首包音频(最好 729 ms);Qwen3-Omni 本地约 146 s |
| DuplexCascade [10] | 无 VAD 级联 | 双工话轮 | Full-Duplex-Bench 最先进;VoiceBench 强;5 万段对话 + LoRA | |
| LTS-VoiceAgent [11] | 重叠级联 | 延迟对推理 | 语义触发;增量推理 | |
| 话轮 / VAP | VAP [12] | 自监督 | 话轮转换、附和 | 零样本任务;建模投影窗口依赖 |
| Prosody-VAP [13] | 消融 | 韵律贡献 | 分离韵律在话轮中的作用 | |
| Multilingual VAP [14] | 跨语言 | 泛化 | 跨语言的话轮预测 | |
| Real-time VAP [15] | 流式 | 连续运行 | 实时连续预测 | |
| Triadic VAP [17] | 多方 | 三方对话 | 超出双人假设 | |
| MuVAP [18] | 因果多模态 | 野外多方 | 角色相对投影;31 小时未剪辑语料 | |
| Sensor-VAP [19] | 耳戴传感器 | 无相机线索 | 不依赖相机的头部运动 | |
| 对话基准 | VoiceBench [20] | 基准 | 助手稳健性 | 真实 + 合成语音;说话人/环境/内容 |
| Full-Duplex-Bench [21] | 基准 | 交互行为 | 停顿、附和、话轮、打断 | |
| FDB v1.5 / v2 / MTR [22, 23, 24] | 基准 | 重叠;多轮;多回合 | 自动主考;跨回合退化 | |
| FLEXI [26] | 基准 | 紧急打断 | 开源与商业在紧急意识上的差距 | |
| MP-Bench [27] | 基准 | 多方参与 | 该说还是保持沉默是否得体 | |
| MSI-Bench [25] | 基准 | 多说话人推理 | 1,152 例;受话人、权限、披露 | |
| 智能体评测 | $\tau$-Voice [28] | 基准 | 可落地任务完成 | 带真实世界复杂度的多轮任务 |
| VAmoS Bench [29] | 仿真支架 | 收口率 | 100 个情景;播种 SQL;痕迹级断言 | |
| FDB-v3 [30] | 基准 | 工具使用 + 不流利 | 自然不流利下的工具正确性 | |
| NemotronLabs VoiceChat [32] | 流式语音到语音 + 工具 | 双工与工具使用,联合 | 打断接手 100%;工具选择 F1 82.5% | |
| IHBench [31] | 基准 | 打断后恢复 | 27 种配置,10 个领域;闭源权重变差慢 $3.3\times$ | |
| MTVA-Bench [33] | 基准 | 级联内部的大语言模型 | 在转写噪声下把大语言模型隔出来 | |
| SpeechGym [34] | 强化学习环境 | 音频原生训练 | 逐轮过程奖励缓解 GRPO 稀疏 | |
| 合成 / 编解码器 | TTS Responsiveness [35] | 基准 | 延迟、尾部延迟 | 13 个开源 TTS;延迟分布 + 可懂度 |
| Speak While You Think [36] | 流式 TTS | 生成过程中合成 | 合成与文本生成重叠 | |
| LiveSpeech [37] | 自回归码 | 零样本低延迟 | 低延迟零样本 TTS | |
| CTC-TTS [38] | 双流 | 对齐 | 基于大语言模型的双流,带 CTC | |
| Mimi analysis [40] | 编解码器可解释性 | 表示质量 | 2048 记号码本;ABX 的局限;80 ms 帧 |
缩写:S2S 为语音到语音;VAP 为语音活动投影;FDB 为 Full-Duplex-Bench;TTFA 为首包音频时间;SOTA 为最先进;VAD 为语音活动检测;LoRA 为低秩适配;GRPO 为组相对策略优化;$F_{1}$ 为精确率和召回率的调和平均。类别颜色与图 1 一致。指标按每项工作自己的说法报告,行与行之间不可比(见第 11 节)。
10 讨论:三条中心说法
前面各节建立证据基础。这里从这些证据论证三条说法,每条写最强支持、最严重的并发症,以及对实践的含义。并发症是故意写的:一条熬过了自己最好反驳的说法,比被写成已定案的说法对读者更有用。
10.1 架构选择是部署约束,不是判决
证据。语料不支持一个干净的赢家。端到端模型保留副语言信息并消除流水线延迟 [1, 5],但 Qiu et al. [9] 里没有完全可自托管的端到端系统满足生产要求,而分块级联达到了最先进的双工行为 [10]。有用的问题不是哪种架构更优,而是哪种约束占主导:自托管、副语言保真,还是可控性。独立地,DuplexCascade 用控制记号和级联内部的分块,只用 5 万段文本对话和轻量 LoRA 适配就得到全双工话轮,而 VAP 研究把话轮建模成直接从音频学到的独立预测目标 [12]。这些结果合在一起表明,双工行为不需要双工架构:它可以作为一层控制策略,加在传统流水线上。
并发症。这不是级联就是更好的证据。DuplexCascade 表明话轮时序可以和端到端音频建模分开;它没有表明级联能收回文本瓶颈按构造丢掉的副语言内容——情绪、非语音声音、韵律细节 [1]。本语料里没有系统在两条轴上同时被评测,所以这个权衡是跨分别进行的研究推断出来的,不是在一次研究里量到的。
含义。自托管和可控性偏向带双工控制策略的级联;副语言内容就是产品的应用——情感计算、治疗、娱乐——偏向端到端建模,尽管当前托管成本高。把这看成约束的谱,而不是质量的单轴,会让以后的架构比较更有信息。
10.2 评测已经从声明转向状态,并且应当把转向做完
证据。早期基准给转写和输出质量打分。现在的基准核验数据库的行 [29]、打断后的流程位置 [31],以及不流利下的工具调用正确性 [30]。Fan et al. [34] 把诊断再磨尖:语音里许多智能体失败是感知上的——从波形里听错一个值——而不是推理失败,部件级的文本评测根本露不出这一点。NVIDIA [32] 表明这个趋势要去的地方:单个开放系统在停顿处理、打断后恢复和工具选择正确性上联合评测,而不是孤立地看一条轴。这个领域已经知道,流利的智能体自信地描述一个它从未执行的动作,是部件指标检测不到的失败模式。
并发症。转向是真的,但不均匀,而且可落地评测比它替换掉的东西更贵。VAmoS Bench 要播种 PostgreSQL 后端,并为 100 个情景手工设计对抗目标 [29];这不像自动转写打分那样便宜地扩展,本语料里的大多数基准——包括 Full-Duplex-Bench 家族里的几版 [21, 22, 23]——仍然报告单一的交互行为轴,而不是经状态核验的结果。这个领域在大多数仪器追上之前,已经认出了正确的目的地。
含义。本文建议把联合报告当成最低标准:一个系统如果只由延迟、只由话轮准确率、或只由任务成功来刻画,那么无论那个数字多强,它仍然没有被刻画清楚。对新基准,可落地的、经状态核验的评测应当是目标方法,同时要明白它费人工,短期内不会完全取代更便宜的部件指标。
10.3 双人假设正在破裂,走在假设它的模型前面
证据。大多数基准和模型假设两个参与者。MP-Bench [27]、三方 VAP [17] 和 MuVAP [18] 表明向多方设定转移,保持沉默的决定成为一等行为。MSI-Bench [25] 测试别人不测的东西:智能体是否正确推理谁说了什么、对谁说、带着什么权限,共 1,152 例,普通话和英语分开。它的家用助手情景有说明性——智能体流利且正确地回答了孩子的问题,如果因此披露了家长的私人指令,仍然失败了。
并发症。这是基准一侧的发现,跑在建模一侧的回应前面。第 4 节和第 5 节的每种架构主要在双人对话上训练和评测;语料里没有端到端或级联系统,在 MSI-Bench 所测的规模上接受过多方权限推理的评测。这些基准确立缺口存在,以及流利的语音理解并不意味着正确的社会推理;它们还没有表明有模型把缺口补上。
含义。对任何有不止一个合法说话人的部署——家用设备、共享工作区助手——谁可以被告知什么,应当是和任务成功并排写明的一等设计要求,而不是事后钉在为单个对话者建造的架构上。
10.4 TRG:联合报告标准从三条说法一起推出
每条说法都独立地反对把实时语音智能体收成一个数字。第 10.1 节表明架构权衡是多维的;第 10.2 节表明结果核验抓住部件指标抓不住的失败;第 10.3 节表明一整条能力轴——得体的沉默和顾及权限的披露——在双人评测里大体缺席。因此本文提出 TRG(时序–恢复–可落地),一套实时语音智能体的最低报告标准:
- T,时序。至少一项在系统预期部署条件下取得的延迟度量,写明它量的是什么(例如首包音频时间),以及它是均值还是尾部统计。用户会经历最坏情况时,报告尾部延迟 [35]。
- R,恢复。对话被打乱之后的行为——打断、附和或假停顿——与未受打扰的表现分开报告,因为恢复在经验上是一条独立的能力轴 [31]。
- G,可落地结果。任务成功对照外部状态核验,而不是对照智能体自己关于做了什么的报告 [29]。
有条件的第四轴(M)。部署允许不止两个合法说话人时,TRG 还要求多方得体性度量,覆盖不说话的决定和顾及权限的披露 [27, 25]。把它保持为有条件的,而不是普遍的,因为严格的双人系统不能因为缺少部署从不使用的能力而受罚。
TRG 故意弱:它规定哪些轴必须出现,不规定每条轴用哪个指标。规定具体指标会把仍在发明仪器的文献定死,语料表明最好的仪器只有两年或更短。说法只是:一份对任何适用的轴保持沉默的报告,会让系统未被刻画,无论其余数字多强。
11 本综述的局限
本文明确写出这份综述的边界,因为综述的覆盖说法本身也是读者必须能检查的结果。
语料规模与选择
38 个来源是聚焦的语料,不是穷尽的。15 篇通过一份本文不能控制其选择标准的种子清单进入,这是主题偏差的可能来源;20 篇由关键词检索加入,这偏向摘要使用同一套词汇的工作;3 篇在后续一轮加入,这有偏向那一轮新发表内容的近时偏差。用不同术语描述这些问题的相关研究,例如语音处理或人机交互文献里的,可能代表性不足。
发表场所与同行评审状态
语料主要是 arXiv 预印本,反映这个领域首先在哪里发表。若干 2026 年的条目还没有完成同行评审。本文报告每篇论文声称什么,并不独立核验它的实验结果。
不做元分析
本文故意不跨论文汇总数字。报告的延迟和准确率是在不兼容的硬件、音频条件和提示设定下测量的,汇总会暗示一种并不存在的可比性。因此表 1 按每项工作自己的术语报告它自己的指标,读者不应把跨行阅读当成排名。
近时性
覆盖到检索日为止。鉴于语料内部观察到的发表速度——Full-Duplex-Bench 这条线在大约十八个月里发布了四版——这份综述需要按月修订,而不是按年。
只有英语和文本可及的来源
所有保留的来源都是英语,并且作为文本可被机器阅读。非英语工作和扫描件没有被检索。
12 开放挑战与结论
本综述把 38 篇关于实时语音智能体的一手来源组织成六个面向应用的类别,对每项工作写它针对的问题、机制和报告的证据。两条轨迹占主导。第一,架构问题仍然真正开放:端到端模型保留级联丢掉的副语言内容,但级联目前在可自托管和可控性上占优,而且双工行为已被表明可以在级联内部得到。第二,评测已经从部件质量决定性地转向对照后端状态核验的可落地结果。
开放挑战
本文指出五项:
- 感知稳健性。Fan et al. [34] 表明语音里的智能体失败常常是感知失败而不是推理失败:听错的参数值级联成失败的通话。文本域评测露不出这一点。
- 恢复是一条独立能力。Salimi et al. [31] 发现打断后的恢复与其他被测的轴大体独立,对话变长时开源权重的差距变大。
- 多方交互。双人假设仍嵌在大多数模型和数据集里 [27, 18],决定何时不说话被测得不够。
- 编解码器可解释性。端到端系统继承编解码器的表示选择,但 Saloev et al. [40] 表明标准评测抓不住这些记号编码了什么。
- 尾部延迟高于平均。Dinh et al. [35] 认为响应性应有一等地位;平均延迟藏起用户实际注意到的最坏体验。
未来方向
从上面的挑战推出三个方向。第一,评测应当联合报告而不是按轴报告:只由延迟、只由话轮准确率或只由任务成功刻画的系统仍然未被刻画,这正是 TRG(第 10.4 节)想变成常规的东西。第二,训练和评测的不对称值得注意——这个领域现在在音频里测量智能体,却仍大体在文本里训练它们,Fan et al. [34] 表明补上这个差距会改变模型学到什么。第三,架构问题会受益于受控比较:级联和端到端系统通常由不同的组在不同任务上评测,所以权衡是推断的,不是测量的。
结束语
这份语料里最有用的教训是方法上的。Meyer et al. [29] 对照数据库状态打分,而不是对照智能体自报,因为流利的系统自信地描述一个从未执行的动作,在转写层面上和成功的系统分不出来。当语音智能体获得行动能力时,评测必须核验后果,而不是核验对话。
一条方法说明
组建这份语料时,本文发现 Full-Duplex-Bench-v3 一个广为流传的 arXiv 标识指向一篇无关的多智能体机器人仿真。正确标识是 2604.04847。因此本综述底下的每份 PDF 都用程序核验过:首页文字与它声称的论文一致。本文建议这个做法:在移动这么快的文献里,按标识引用并不会自我验证。Pedinotti and Santus [41] 对自动综述构造提出相关的一点:无结构的检索迫使综合系统在生成时从原始文本推断一个领域的概念组织,这正是产生听起来像样、却没有依据的说法的失败模式。像本文这样,在综合之前先把检索和核验结构化,是更站得住的操作顺序。
数据可得性
本综述底下的语料在 https://github.com/shivamnegi92/voice-agent-eval-corpus ,并在 Zenodo 存档。它以结构化元数据发布:每个来源一条记录,含标识、分类类别、核验状态,以及所分析 PDF 的 SHA-256。一个抓取脚本从原始主机重建本地副本并核对每个哈希,所以语料可以独立审计。论文本身不随包分发:许可证审计发现 41 个来源里只有一个带有明确的开放许可授予。发布物还包含一份可填写的 TRG 报告模板,以及第 10.4 节所提标准的合规校验器。
参考文献
- [1] A. Défossez, L. Mazaré, M. Orsini, A. Royer, P. Pérez, H. Jégou, E. Grave, and N. Zeghidour, “Moshi: a speech-text foundation model for real-time dialogue,” arXiv preprint arXiv:2410.00037, 2024.
- [2] B. Veluri, B. N. Peloquin, B. Yu, H. Gong, and S. Gollakota, “Beyond turn-based interfaces: Synchronous llms as full-duplex dialogue agents,” arXiv preprint arXiv:2409.15594, 2024.
- [3] W. Cui, D. Yu, X. Jiao, Z. Meng, G. Zhang, Q. Wang, Y. Guo, and I. King, “Recent advances in speech language models: A survey,” arXiv preprint arXiv:2410.03751, 2024.
- [4] M. Gupta, A. Dutta, and A. Maurya, “Direct speech-to-speech neural machine translation: A survey,” arXiv preprint arXiv:2411.14453, 2024.
- [5] SII OpenMOSS Team, “Moss-speech: Towards true speech-to-speech models without text guidance,” arXiv preprint arXiv:2510.00499, 2025.
- [6] Q. Zhang, L. Cheng, C. Deng, Q. Chen, W. Wang, S. Zheng, J. Liu, H. Yu, C. Tan, Z. Du, and S. Zhang, “Omniflatten: An end-to-end gpt model for seamless voice conversation,” arXiv preprint arXiv:2410.17799, 2024.
- [7] T. Labiausse, R. Fabre, Y. Estève, A. Défossez, and N. Zeghidour, “Simultaneous speech-to-speech translation without aligned data,” arXiv preprint arXiv:2602.11072, 2026.
- [8] W. Nakata, Y. Saito, and H. Saruwatari, “Duplexchat: Constructing speaker-separated full-duplex dialogue speech at scale for spoken dialogue language modeling,” arXiv preprint arXiv:2607.04941, 2026.
- [9] J. Qiu, Z. Chen, L. Yang, M. Zhu, Z. Liu, J. Tan, W. Zhao, R. Murthy, R. Ram, A. Prabhakar, S. Heinecke, C. Xiong, S. Savarese, and H. Wang, “Building enterprise realtime voice agents from scratch: A technical tutorial,” arXiv preprint arXiv:2603.05413, 2026.
- [10] J. Yang, Y. Fujita, and Y. Sudo, “Duplexcascade: Full-duplex speech-to-speech dialogue with vad-free cascaded asr-llm-tts pipeline and micro-turn optimization,” arXiv preprint arXiv:2603.09180, 2026.
- [11] W. Zou, Y. Miao, Z. Ma, J. Xu, J. Gao, J. Hao, R. He, and J. Xu, “Lts-voiceagent: A listen-think-speak framework for efficient streaming voice interaction via semantic triggering and incremental reasoning,” arXiv preprint arXiv:2601.19952, 2026.
- [12] E. Ekstedt and G. Skantze, “Voice activity projection: Self-supervised learning of turn-taking events,” in Interspeech, 2022, arXiv:2205.09812.
- [13] ——, “How much does prosody help turn-taking? investigations using voice activity projection models,” arXiv preprint arXiv:2209.05161, 2022.
- [14] K. Inoue, B. Jiang, E. Ekstedt, T. Kawahara, and G. Skantze, “Multilingual turn-taking prediction using voice activity projection,” arXiv preprint arXiv:2403.06487, 2024.
- [15] ——, “Real-time and continuous turn-taking prediction using voice activity projection,” arXiv preprint arXiv:2401.04868, 2024.
- [16] T. Saga and C. Pelachaud, “Voice activity projection model with multimodal encoders,” arXiv preprint arXiv:2506.03980, 2025.
- [17] M. Elmers, K. Inoue, D. Lala, and T. Kawahara, “Triadic multi-party voice activity projection for turn-taking in spoken dialogue systems,” arXiv preprint arXiv:2507.07518, 2025.
- [18] H. Qi and G. Skantze, “Muvap: Multimodal multiparty voice activity projection for turn-taking prediction in the wild,” arXiv preprint arXiv:2606.16731, 2026.
- [19] S. Hamanaka, Y. Kishino, Y. Tsunomori, S. Mizutani, Y. Chiba, T. Okoshi, and J. Nakazawa, “Sensor-augmented voice activity projection for enhancing turn-taking prediction,” in Proceedings of SIGDIAL, 2026, pp. 164–169.
- [20] Y. Chen, X. Yue, C. Zhang, X. Gao, R. T. Tan, and H. Li, “Voicebench: Benchmarking llm-based voice assistants,” arXiv preprint arXiv:2410.17196, 2024.
- [21] G.-T. Lin, J. Lian, T. Li, Q. Wang, G. Anumanchipalli, A. H. Liu, and H.-y. Lee, “Full-duplex-bench: A benchmark to evaluate full-duplex spoken dialogue models on turn-taking capabilities,” arXiv preprint arXiv:2503.04721, 2025.
- [22] G.-T. Lin, S.-Y. S. Kuan, Q. Wang, J. Lian, T. Li, S. Watanabe, and H.-y. Lee, “Full-duplex-bench v1.5: Evaluating overlap handling for full-duplex speech models,” arXiv preprint arXiv:2507.23159, 2025.
- [23] G.-T. Lin, S.-Y. S. Kuan, J. Shi, K.-W. Chang, S. Arora, S. Watanabe, and H.-y. Lee, “Full-duplex-bench-v2: A multi-turn evaluation framework for duplex dialogue systems with an automated examiner,” arXiv preprint arXiv:2510.07838, 2025.
- [24] H. Zhang, W. Cui, H. Xu, X.-H. Li, L. Zhu, H. Bai, S. Ma, and I. King, “Mtr-duplexbench: Towards a comprehensive evaluation of multi-round conversations for full-duplex speech language models,” arXiv preprint arXiv:2511.10262, 2025.
- [25] C. Xiong, D. Shen, Y. Tang, W. Ma, M. Li, and A. Smola, “Msi-bench: Evaluating multi-speaker voice interaction for collaborative ai agents,” arXiv preprint arXiv:2609.24812, 2026.
- [26] Y. Ge, S. Chen, J. Xiao, X. Liu, T. Xiao, Y. Xiang, Z. Yu, and J. Zhu, “Flexi: Benchmarking full-duplex human-llm speech interaction,” arXiv preprint arXiv:2509.22243, 2025.
- [27] Y.-J. Shih, S.-Y. S. Kuan, G.-T. Lin, K.-W. Chang, S. Arora, S.-w. Yang, A. Mohamed, S. Watanabe, H.-y. Lee, and D. Harwath, “Mp-bench: Evaluating voice agents as a multiparty conversation participant,” arXiv preprint arXiv:2609.13076, 2026.
- [28] S. Ray, K. Dhandhania, V. Barres, and K. Narasimhan, “$\tau$-voice: Benchmarking full-duplex voice agents on real-world domains,” arXiv preprint arXiv:2603.13686, 2026.
- [29] J. Meyer, S. Shayegan, R. Tambi, A. Khan, S. Kim, V. Shih, M. Jamei, and A. Partovi, “Vamos bench: Voice agent simulation bench,” arXiv preprint arXiv:2607.27453, 2026.
- [30] G.-T. Lin, C. Chen, Z. Chen, and H.-y. Lee, “Full-duplex-bench-v3: Benchmarking tool use for full-duplex voice agents under real-world disfluency,” arXiv preprint arXiv:2604.04847, 2026.
- [31] A. Salimi, W. Ma, Y. Tang, D. Shen, M. Li, and A. Smola, “Ihbench: Evaluating post-interruption recovery in voice agents with structured workflows,” arXiv preprint arXiv:2606.19595, 2026.
- [32] NVIDIA, “Nemotronlabs voicechat: An open full-duplex speech-to-speech model with tool calling capabilities,” arXiv preprint arXiv:2609.21967, 2026.
- [33] P. Mishra, I. Kumar, A. Mandoli, and S. Kamath, “Mtva-bench: Evaluating the language model inside cascaded voice agents,” arXiv preprint arXiv:2609.20152, 2026.
- [34] J. Fan, J. Li, P. G. Shivakumar, J.-H. Huang, Q. Luo, I. Bulyko, G. Liu, and R. Ren, “Speechgym: An audio-native gym for training voice agents via reinforcement learning,” arXiv preprint arXiv:2608.26432, 2026.
- [35] H. P. T. Dinh, R. A. Patamia, M. Liu, and A. Cosgun, “Benchmarking the responsiveness of open-source text-to-speech systems,” Computers, vol. 14, no. 10, p. 406, 2025.
- [36] A. Dekel, S. Shechtman, R. Fernandez, D. Haws, Z. Kons, and R. Hoory, “Speak while you think: Streaming speech synthesis during text generation,” arXiv preprint arXiv:2309.11210, 2023.
- [37] T. Dang, D. Aponte, D. Tran, and K. Koishida, “Livespeech: Low-latency zero-shot text-to-speech via autoregressive modeling of audio discrete codes,” arXiv preprint arXiv:2406.02897, 2024.
- [38] H. Liu, S. Yusuyin, H. Huang, and Z. Ou, “Ctc-tts: Llm-based dual-streaming text-to-speech with ctc alignment,” arXiv preprint arXiv:2602.19574, 2026.
- [39] E. Casanova, J. Kim, M. G. Fuenmayor, S. Hussain, V. Klimkov, V. Mendelev, M. Desta, P. Neekhara, P. Zelasko, C. Chen, E. Rastorgueva, K. Hu, A. Pasad, X. Yang, A. Alja’fari, R. Roy, R. Badlani, J. Roche, J. Li, and Z. Chen, “Voicechat-tts: A low-latency continuous speech synthesis model for interactive agents,” arXiv preprint arXiv:2608.13831, 2026.
- [40] A. Saloev, E. Pacquetet, and N. Ballier, “Using the mimi codec for metalinguistic representations,” arXiv preprint arXiv:2608.15799, 2026.
- [41] P. Pedinotti and E. Santus, “Structsurvey: Structured agentic retrieval for automated survey paper generation,” arXiv preprint arXiv:2607.01243, 2026.
出处:Shivam Negi, Arpit Rawat, Rashi Jain,Evaluating Real-Time Voice Agents: From Component Quality to Grounded Outcomes,2026-09-28,https://arxiv.org/abs/2609.30798,CC BY 4.0。
觉得有用,转给同事
微信扫码
用微信扫一扫,在手机上打开后即可转发。