CodexQA

行业与实践研究与基准测试

混合执行成功率 91.04%:阿里用 134 道座舱任务评语音智能体

CodexQA 团队阅读约 4 分钟

134 例座舱任务里,混合执行成功率 91.04%,直接调工具 72.39%,全部委托 80.60%。都做成功的回合上,总体时延 4.729 秒,相对这两档低 26.73% 和 30.91%。短任务和多步并不是都最快。

本文目录

混合执行成功率 91.04%:阿里用 134 道座舱任务评语音智能体

阿里巴巴 Token Foundry 的 Qwen-Audio-Agent(语音智能体运行时:前台管对话,后台跑长任务),arXiv 提交日 2026 年 9 月 21 日(2609.25195,v1)。作者按姓氏字母序:Chong Deng、Yunjie Ji、Yuxiang Kong、Xiangang Li、Xu Li、Binbin Zhang、Haina Zhu、Jianheng Zhuo。单位是 Alibaba Token Foundry, Alibaba Group。许可证是 CC BY 4.0。

全双工语音里,打断一句回复不该把正在做的任务一起取消;任务做完时用户可能还在说话,结果要先留着。他们用 harness 指连接模型、工具和执行环境的运行时。前台智能体听流式输入、维持对话,并在直接调工具和交给后台之间选择。后台用自己的上下文、工具和工作区做被委托的任务。编排运行时跟踪状态,把进度、追问和结果送回对话。

任务状态和说话分开

委托走 spawn_thinking。前台提交一条自包含目标,因为对话历史和记忆不会自动带给后台。运行时建任务记录,马上回一个任务编号,对话可以继续。状态分成排队、运行,以及完成、失败、取消。打断只停语音,任务还在。取消要另走后台支持的控制。结果送达和执行完成也分开:用户正在说话或前台正在回复时,结果先留着;同一收集窗口里的结果合成一次回复。送达失败可以重试,不必把已完成的工作再做一遍。

环境事件用统一协议,和前台供应商无关。每种事件有自己的结构、保留规则和响应策略。运行时可以自己处理、静默更新上下文、安排回复,或打断当前回复再要一条新的。座舱里用户从界面改了目的地,新目的地可以进上下文,而不必开口播报。

记忆是有界快照:交互规则、助手画像、显式偏好和长期记忆。当前请求优先于存好的偏好,显式偏好优先于推断偏好。被用户拒绝的偏好不能自动再加。远程检索和整理可以异步做。任务记录、参考文档和个人记忆分开。

三处应用,评测只做座舱

桌面助手把文件、代码和核验交给后台,前台仍可问进度。做完返回摘要和产物引用,完整交付留在工作区。座舱把即时控制和导航、以及部分购物和查询放在同一套业务状态上。参考应用按领域分工具;基准里的混合执行则是两条路都能用同一批工具,由模型自己选。语音客服把资格和金额放进共享业务服务。需要批准的操作先预览再提交:工具准备好变更,后台暂停,前台问用户,同意后再提交。文中还提到数字人和智能硬件已部署,没有给这两处的数字。

134 道题,四条执行路径

内部座舱基准 134 例:86 个短交互、48 个多步任务,一共 159 个用户回合。四条配置共用 41 个业务工具、相同初始状态和评分标准。前台是 Qwen Audio 3.0 Realtime Plus,后台是 qwen3.8-max。三条语音配置输入相同,只改路由:直接由前台调工具;全部委托给后台;混合执行自适应选择。另有一条纯文本后台,直接拿对应文本调工具。能力指标改编自 FDB V3(Full-Duplex-Bench 第三版,全双工语音智能体基准),再加上按执行结果算的任务成功。

表 2 上半是 134 例上的能力。Tool F1 是 0 到 1,其余是百分比。

配置Tool F1参数准确率任务成功回复质量
语音前台,直接调工具0.94793.672.3995.5
语音前台,全部委托0.90889.880.6089.6
纯文本后台,直接调工具0.96394.190.30100.0
语音前台,混合执行0.96295.291.0497.8

混合执行的任务成功率最高,91.04%。它不是每一列都最高:Tool F1 和回复质量是纯文本后台更高,0.963 和 100.0。直接执行短任务成功 83/86,多步只有 14/48。全部委托把多步做到 37 例,短任务掉到 71。混合是短任务 84、多步 38。纯文本后台的分项例数没有给出。

时延只在大家都做对的回合上比

时延另测。80 个用户回合、来自 71 例,四条配置都做成功才进入这组。从说完或提交文本开始,到任务完成结束,后面的回复生成和播放不算。其中短任务 74 回合,多步 6 回合。

配置短任务多步总体
语音前台,直接调工具1.48867.7056.455
语音前台,全部委托4.26638.6536.845
纯文本后台,直接调工具3.14935.4495.572
语音前台,混合执行1.59143.4304.729

单位是秒,越低越好。混合的总体均值 4.729 秒,比直接执行低 26.73%,比全部委托低 30.91%。这组回合里,混合把全部短任务交给前台、全部多步交给后台。短任务上直接执行更快,1.488 秒对 1.591 秒。多步上纯文本后台 35.449 秒、全部委托 38.653 秒,都快于混合的 43.430 秒。总体更低,是因为短任务占了 74/80。

限制

论文没有单列限制。结论把下一步放在任务进行中的对话行为、更长会话里的恢复,以及更多模型、智能体和设备上的个性化。数字只来自这一套内部座舱基准和这四条配置。桌面、客服、数字人、智能硬件没有同一张表。时延样本把失败回合排除了,多步只有 6 个回合。混合执行在这组成功回合上总体最快,不能读成每一类任务都最快,也不能外推到别的座舱或公开基准。

阿里巴巴 Token Foundry,Chong Deng、Yunjie Ji、Yuxiang Kong、Xiangang Li、Xu Li、Binbin Zhang、Haina Zhu、Jianheng Zhuo,Qwen-Audio-Agent Technical Report,2026-09-21,https://arxiv.org/abs/2609.25195

觉得有用,转给同事

微信扫码

用微信扫一扫,在手机上打开后即可转发。

用 RSS 订阅

提交勘误