CodexQA

Industry & PracticeResearch & Benchmarks

29 项平均分涨超 25%,时价按两分钟的 30 倍估算:Qwen3.8-Omni-Flash

CodexQA 团队4 min read

Qwen3.8-Omni-Flash 的 29 项平均分比 Qwen3.5-Omni-Plus 提高超过 25%。OmniVideoBench 上准确率 63.4 到 67.8,token 从 145736 降到 79117。时价降幅按两分钟成本的 30 倍估算,不是准确率。

In this piece

29 项平均分涨超 25%,时价按两分钟的 30 倍估算:Qwen3.8-Omni-Flash

阿里云社区在 2026 年 9 月 20 日介绍了全模态模型 Qwen3.8-Omni-Flash。它要做的不是只看懂音视频,而是在看懂之后规划任务、调用工具并交出成品。评测数字和价格口径写在同一段,两边不能混读。

先看 29 项和两笔价格

文本、图像、音频、视频都能进,上下文窗口是 1M token。原文说文本表现和同尺寸纯文本模型相当。29 项评测的平均分比 Qwen3.5-Omni-Plus 提高超过 25%。音频输入的时价降幅超过 98%,音视频输入的时价降幅超过 93%。

时价不是准确率。脚注写明:按两分钟素材输入成本的 30 倍估算一小时;音视频用 720p、1fps。Gemini 3.8 Flash 的 media_resolution 取 high,Seed 2.0 Lite 的 max_frame_tokens 取 384,其余 API 参数用默认值。文本输入和输出价格按每 1M token 的人民币计,Gemini 与 Muse 从美元换算,汇率 1 USD = 6.7191 CNY。

这 29 项的名单也在脚注里。音频推理:AliMeeting-test、AISHELL-4、MagicData-RAMC、MLC-SLM(en)、WenetSpeech(Net | Meeting)、FLEURS-60 ASR、FLEURS-60 S2TT、SpotSoundBench、MMAU、MMAR、MMSU、MuchoMusic-RUL、HumMusQA、MusTBench、Audio-MultiChallenge、WildSpeech、VoiceBench。音视频推理:DailyOmni、WorldSense、AVUT、JointAVBench、OmniCloze、OmniCap-IF、QIVD、OmniVideoBench、StreamingBench。音视频 Agent:WildClawBench-MM、UniClawBench、OmniGAIA。正文没有给出 29 项各自的绝对分。

音视频 Agent、编程和长程任务上,WildClawBench-MM 提高 36.5 分,AgenticVBench 提高 22.3 分,UniClawBench 得到 69.6。长音频和音视频理解里,LongAudioSpan 提高 8.3 分,OmniVideoBench 提高 9.6 分。OmniCap-IF 的 CSR 提高 8.5 分,ISR 提高 14.1 分。AliMeeting 的 DER 和 cpWER 从 88.11 / 89.61 降到 3.35 / 17.18。原文的对照结论是:音频表现超过 Gemini 3.8 Flash,音视频表现接近 Gemini 3.8 Flash。没有写出 Gemini 在这 29 项上的平均分。

长视频不看完全片,省下的是 token

数小时视频如果从头看到尾,算力和 token 都花在无关片段上。Qwen3.8-Omni-Flash 的原生 Agent 从问题出发,自己决定看哪一段、听哪一段,用多轮由粗到细的取证定位关键信息。

OmniVideoBench 上,Agentic Understanding 相对 Static Understanding,准确率从 63.4 提到 67.8,每条查询的 token 从 145,736 降到 79,117,大约少 45.7%。注记写明:Agentic 模式跨轮保留上下文。所以 token 下降不能单独理解成「每轮都从零开始还更省」。

会议场景里,说话人会轮流、重叠,指代也会变。模型把音频和视频里的说话人一起认,原生支持最长 1 小时的音视频输入,端到端做说话人切分、转写和身份对齐。再接到工具之后,可以发邮件、整理任务,甚至按会议要求开始写代码。1 小时是输入上限,不是评测得分。

和 Gemini 比的时候要看模式

Agentic Omni Understanding 让模型从问题出发规划、调用工具、逐步核对证据。对照模型是 Gemini 3.8 Flash。两种设置:Static 是直接理解输入;Agent 模式用的是 Qwen Code。

OmniVideoBench(音视频推理):Qwen Static 63.4,Qwen Code 67.8;Gemini Static 65.2,Qwen Code 下的 Gemini 70.1。Video-MME-v2(音视频推理):65.0 / 71.3,对照 71.0 / 72.7。LVOmniBench(长视频推理):63.3 / 73.6,对照 70.7 / 70.7。Gemini 在 LVOmniBench 上,Agent 模式没有从 70.7 再涨。Qwen 在三行上都涨了,但 OmniVideoBench 和 Video-MME-v2 的 Agent 分数仍然低于同一模式下的 Gemini。

12 小时改小模型,只报了一个 CER

他们给 Qwen3.8-Omni-Flash 的任务是:12 小时内改进 Qwen2.5-Omni-3B 的四川话语音识别,并交出可用模型。它自己选了 WenetSpeech-Chuan,固定评测标准,建立基线,听样本、看识别结果、造针对性训练数据。连续四轮实验做出 3,413 条训练样本,有效的留下,无效的回滚。同一评测集上,字错误率从 25.79% 降到 15.30%,相对降幅大约 40.7%。原文没有给出其余方言、其余指标,也没有给出这 12 小时里失败轮次的分数。

实时接口 Qwen3.8-Omni-Flash-Realtime 另写了吞吐和延迟,正文没有给出具体毫秒数或 QPS。语音识别覆盖 74 种语言、39 种方言;语音生成覆盖 29 种语言、7 种方言。reasoning_effort 有三档:xhigh 是默认,用于要深入分析的复杂任务;medium 平衡准确和速度;low 偏向速度和成本。preserve_thinking 默认在所有场景打开。这些是接口设置,不是评测结果。

读的时候只保留原文给得出的边界:超过 25% 是 29 项平均分相对 Qwen3.5-Omni-Plus,不是对 Gemini;超过 98% 和超过 93% 是按脚注口径估算的时价,不是准确率;145,736 到 79,117 只对应 OmniVideoBench 这一张表;Gemini 的 70.7 在 LVOmniBench 的两种模式里没有变化;15.30% 只是四川话这一套评测集的 CER。

出处:阿里云,Alibaba Cloud Community,Qwen3.8-Omni-Flash: Omni Senses. Agentic Delivery.,2026-09-20,https://www.alibabacloud.com/blog/qwen3-8-omni-flash-omni-senses--agentic-delivery-_603580

Found it useful? Pass it on

WeChat

Scan with WeChat to open it on your phone and forward it.

Subscribe via RSS

Submit a correction