Industry & PracticeResearch & Benchmarks
多数 场景 可用 率 到了 90 %, 对照 模型 的 分数 没 写 出来: Seed Audio 1.0 的 主观 评 测
字节 Seed Audio 1.0 把人声、音效和环境声放在同一框架里生成。多数场景可用率到 90% 以上,自然度多数语言 MOS 超过 4,但 AB 对照的模型名和差值没有进正文。

多数场景可用率到了 90%,对照模型的分数没写出来:Seed Audio 1.0 的主观评测
字节跳动 Seed 团队在 2026 年 7 月 20 日发布了音频创作模型 Seed Audio 1.0。它把人声、音效和环境声放在同一个框架里生成,而不是先分别生成再人工拼接。评测写在文末,分三块。图上的对照分数没有进正文。
生成之前先定三条门槛
完整声音场景要过三关。不同声音要的细节不一样:语音看清晰度和韵律,环境声要空间氛围稳定。一段音频里,要素之间有时间、情绪和声学上的互相影响,模型要理解的是整段场景,不是单条素材。控制条件也不只一种:文本、参考音频、时间轴和角色设定都要服从。
他们训练了一个通用声学编码器,把各类声音映射到同一套声学表征,而不是按任务分开编码。生成时先把意图拆成结构化时间线,标出角色、台词、情绪和音效什么时候进来。当前时间控制的间隔精度是 100 毫秒。这是控制粒度,不是评测得分。
零样本生成可以用文字描述目标声音,也可以加参考音频,不用为每种声音单独训模型。长音频当前单次大约 2 分钟,可以在此基础上延长,并保持角色音色。同一音色还要能换成不同情绪,原文称为「单音色、多角色」。语种覆盖 20 个以上,正文点名的有中文、英文、日语、韩语、西班牙语、印尼语、德语、法语、泰语、越南语。
三块评测,只有两块给了门槛数字
评测从文本生成音色、多场景创作、多语种生成三边做。
文本生成音色用 AB 主观评测。原文只写 Seed Audio 1.0 有显著优势,可用率和优良率也明显提升。没有写出对照模型的名字、听音人数、样本条数,也没有写出优势是几个点。这些数在配图里,正文没有。
多场景评了影视、电视节目、短剧、动漫、播客对话、直播带货、网络创作、话剧和语音合成。多数场景的音频可用率达到 90% 以上。原文没有逐场景列出哪几个没到 90%,也没有定义「可用」的评分规则。
多语种用人工评测,看指令遵循和音频自然度。自然度上,大部分语言的 MOS 超过 4 分。复杂音频的指令遵循,除越南语外,其余语言的 MOS 都高于 3.5 分。越南语被单独拿出来说没有过 3.5,但没有给出它的实际分数。同样没有听音人数。
还没做的不要写成已经测过
文末的计划是:支持视频参考等更多模态,做长音频和分轨,以及把可控翻译接进来,让多语种同时受内容和时长约束。这些是下一步,不是这次评测的结果。体验中心上线也不是分数。
读的时候只保留原文给得出的边界:100 毫秒是时间控制精度,约 2 分钟是单次生成长度;90% 以上是「多数场景」的可用率,不是九个场景全部;MOS 超过 4 和高于 3.5 没有样本量和听音人数;AB 优势没有公开对照模型和差值;越南语是指令遵循没过 3.5 的例外,自然度是否过 4 没有单独写。
出处:字节,字节跳动 Seed 团队,从“会说”走向“会创作”| Seed Audio 1.0 音频创作模型发布,2026-07-20,https://seed.bytedance.com/blog/from-speech-to-audio-creation-introducing-the-seed-audio-1-0-audio-creation-model
Found it useful? Pass it on
Scan with WeChat to open it on your phone and forward it.