同 一套 API 下 四项 公开 集 最低: 阿里 评 Qwen - Audio - 3.0 - ASR
B 栏里 FLEURS 中英和 LibriSpeech 两项最低,AISHELL 与 WeNetSpeech 不是。16 种方言宏平均 CER 9.40%。400 毫秒流式的中文 CER 9.24%,非流式 8.03%。

本文目录
同一套 API 下四项公开集最低:阿里评 Qwen-Audio-3.0-ASR
阿里巴巴 Token Foundry、Qwen-Audio ASR Team 的 Qwen-Audio-3.0-ASR(在 Qwen 混合专家骨干上做语音识别,指令里可以同时指定语言、润色、历史文本和热词),arXiv 提交日 2026 年 9 月 7 日,当前页为 9 月 9 日修订的 v2(2609.07549)。作者按姓氏字母序,正文列在原文第 7 节。许可证是 CC BY 4.0。
报告要补的缺口是:一种方言一个模型、热词比训练集变得快、以及想去掉口吃和自我更正就得再跑一遍大模型。系统覆盖 30 种语言、八大方言区里的 16 种汉语变体,另有流式版本 Qwen-Audio-3.0-ASR-Streaming。
五段训练,奖励按样本分流
编码器先做 BEST-RQ 自监督,再做有监督的注意力编码器—解码器,语料是数千万小时。兼容的 Transformer 层从 Qwen3 初始化,因果注意力改成双向。有监督标签经过语音活动检测、Paraformer-V2、Whisper、SenseVoice 的伪标签和逆文本正则。这一段的解码器随后丢掉,只留下编码器。
音频大模型预训练大约 2000 万小时,编码器冻结,适配器和语言模型一起训。冷却阶段大约 100 万小时,用 VibeVoice 再识别,错误率超过 0.3 的样本删掉,并加入音频理解、说话人日志和 SpeechQA。监督微调又是数千万小时:基座语言模型冻结,解码器走 LoRA,编码器和适配器更新。序列打包到 8192 token。指令可以组合语言、润色、历史转写和两级热词。P0 是高置信、要优先的词,P1 是更宽的候选,由大模型按和参考转写的语义匹配来分档。
强化学习用 FunVerl-ASR,全异步。数据包括和 Whisper、FireRed-ASR、SenseVoice 不一致的难例、超过 20 秒的长句、幻觉和真的长重复、热词,以及防止遗忘的普通样本。奖励可以是规则(字错、关键词、热词命中、上下文实体、幻觉、语言一致)或大模型裁判,并按样本来源分流。热词奖励对 P0、P1 用不同的正负权重。
公开集要分成两张表
中文报 CER,英文报 WER,越低越好。表 1 的 A 栏是别人官方仓库或技术报告里的数字,预处理和评分可能不一致,尤其 WeNetSpeech-net:他们自己的结果用了修正后的参考文本,对照仍是原文报告的数。B 栏是同一套 API 管线重跑的,定量比较以 B 栏为主。
A 栏,Qwen-Audio-3.0-ASR:AISHELL-1 1.03,AISHELL-2 2.02,FLEURS-zh 2.08,FLEURS-en 4.17,LibriSpeech-clean 1.19,LibriSpeech-other 2.24,WeNetSpeech-net 4.31。七项里四项最低。相对该项最强官方对照:AISHELL-2 低 0.08 个百分点(相对 3.8%),FLEURS-zh 低 0.60(相对 22.4%),LibriSpeech-other 低 0.18(相对 7.4%),WeNetSpeech-net 低 0.36(相对 7.7%)。LibriSpeech-clean 距离最好成绩 0.02 以内,但不是最低:Step-Audio 2 是 1.17。AISHELL-1 上 FireRed-ASR 是 0.54,低于 1.03。FLEURS-en 上 Step-Audio 2 是 3.03,低于 4.17。
B 栏,同一管线。GPT-4o Transcribe、Azure、豆包、Fun-ASR-Flash、腾讯 Hy-ASR-3.0-preview、Qwen 依次为:
| 测试集 | GPT-4o | Azure | 豆包 | Fun-ASR-Flash | 腾讯 Hy | Qwen |
|---|---|---|---|---|---|---|
| AISHELL-1 | 3.34 | 1.60 | 1.54 | 0.76 | 0.78 | 1.03 |
| AISHELL-2 | 4.47 | 3.24 | 2.66 | 1.93 | 2.15 | 2.02 |
| FLEURS-zh | 6.14 | 5.51 | 8.18 | 5.52 | 2.38 | 2.08 |
| FLEURS-en | 5.79 | 5.47 | 6.50 | 4.95 | 5.45 | 4.17 |
| LibriSpeech-clean | 1.58 | 1.90 | 3.36 | 1.35 | 1.60 | 1.19 |
| LibriSpeech-other | 3.87 | 3.54 | 4.46 | 2.51 | 2.68 | 2.24 |
| WeNetSpeech-net | 12.27 | 4.58 | 4.81 | 3.83 | 4.16 | 4.31 |
四项最低:FLEURS-zh 比腾讯低 0.30 个百分点(相对 12.6%),FLEURS-en 比 Fun-ASR-Flash 低 0.78(相对 15.8%),LibriSpeech-clean 低 0.16(相对 11.9%),LibriSpeech-other 低 0.27(相对 10.8%)。AISHELL-1 和 AISHELL-2、WeNetSpeech-net 都是 Fun-ASR-Flash 更低,Qwen 在 AISHELL-2 上距最好成绩 0.09 以内。
多语言表 2 的宏平均只统计该基准上每种语言都有结果的系统。GigaSpeechBench 七种东亚和东南亚语言,Qwen 宏平均 22.50%,是完整系统里最低,七种里五种最低;Azure 有语言缺失,不进宏平均。Common Voice 15 宏平均 4.57%,七种里六种最低。FLEURS 九种语言宏平均 4.94%,低于豆包 6.30 和腾讯云 13.40,高于 GPT-4o Transcribe 的 3.95;九种里四种最低。越南语 Common Voice 上 Qwen 是 8.29,腾讯云是 5.67。
方言、热词、润色和流式
内部 16 种方言。四川、山西、河南、济南、粤语、陕西、青岛按原方言转写。上海、南昌、宁波、客家、杭州、温州、湖南、福建、苏州把方言翻成普通话。宏平均 CER:Qwen 9.40%,豆包 16.77%,腾讯 Hy-ASR-3.0-preview 20.40%,16 项里 11 项最低。温州是 14.22%,对照 64.63% 和 64.66%。一致性由 Qwen3.7-Max 按 0 到 10 分打,先看语义再看任务是否做对,不少于 6 分算一致。图 7 没有在正文给出逐方言的一致率。
15 个行业的实体召回,图 8 把每个领域单独归一化到外环,正文没有逐领域百分比,只写 Qwen 在全部领域最高,软件与 IT 里的库、框架和 API 名差得更明显。作者把增益和实体挖掘、合成数据对齐,也写明模型其他改动可能有份。
热词召回(%),无热词 / 有热词:
| 类别 | 豆包 | Fun-ASR-Flash | Qwen |
|---|---|---|---|
| 人名 P0 | 32.27 / 82.64 | 37.33 / 95.26 | 62.12 / 99.43 |
| 主题词 P0 | 75.14 / 93.06 | 71.84 / 92.53 | 69.36 / 99.42 |
| 主题词 P1 | 84.36 / 93.04 | 86.02 / 96.73 | 88.46 / 95.31 |
| 热词 P0 | 48.24 / 91.95 | 43.26 / 82.53 | 63.08 / 99.46 |
| 热词 P1 | 51.24 / 89.48 | 53.92 / 87.00 | 74.00 / 88.34 |
| AI 实体 P0 | 44.21 / 65.24 | 79.88 / 90.55 | 88.22 / 99.39 |
| 品牌 P0 | 44.18 / 57.88 | 80.14 / 95.55 | 83.83 / 97.95 |
| 产品实体 P0 | 67.59 / 78.70 | 73.64 / 89.92 | 72.87 / 99.07 |
P0 加上热词后,Qwen 全部最高。P1 的提升小于对应的 P0,和更弱的条件权重一致。主题词 P1 上 Fun-ASR-Flash 加了热词是 96.73,高于 Qwen 的 95.31。
长音频把同一会话里已经识别的文本当作上下文,不维护热词表。表 4 是例子,不是汇总错误率。润色和识别同一次解码。内部 5 分量表上,可读性从原始转写的 2.53 到 3.44;忠实度 3.44,对照把同一原始结果交给 Qwen3.6-Plus 再写一遍是 3.47。少一次模型调用,忠实度略低。
流式在内部中英文工业集上测,解码和时延都在 NVIDIA H100。首 token 时延和上屏时延都从该语音单元的声学结束,量到它第一次出现在屏幕上的部分转写里。低时延配置的首 token 低于 200 毫秒,上屏低于 300 毫秒。算法时延 400 毫秒这一点:中文 CER 9.24%、英文 WER 13.38%;非流式是 8.03% 和 11.78%,相对错误大约高 15.1% 和 13.6%。图 11 的其余工作点没有逐点列表。非流式错误率最低。
限制
A 栏不能和 B 栏直接比绝对数。WeNetSpeech-net 的参考文本经过修正。方言 CER、实体召回、热词、润色和流式都是内部集,图 6 到图 8、图 11 的未写入正文的格子这里不补。FLEURS 宏平均不是全场最低。流式用更低错误率换更高时延,400 毫秒点已经高于非流式。报告没有把这些数字写成可以外推到未测语言或未测行业。
阿里巴巴 Token Foundry,Qwen-Audio ASR Team,Qwen-Audio-3.0-ASR Technical Report,2026-09-07,https://arxiv.org/abs/2609.07549
觉得有用,转给同事
微信扫码
用微信扫一扫,在手机上打开后即可转发。