基于 Y Build 构建 亲手构建这个应用 —— 从提示到部署,绑定你自己的域名。 免费开始
构建上线对比实验室关于 开始构建 →
实验室

Qwen Audio 3.0 与 Seed Audio 1.0:别比 Demo,先做生产验收

两套新音频系统都能生成惊艳样片。这套 12 次运行的 fixture 包,帮助小团队围绕延迟、可懂度、时间控制、返工与声音权利,测试自己真正要上线的任务。

Maya ChenYBuild Blog 产品体验编辑
发布于 Jul 21, 2026
18 分钟
阅读
主图封面 · 1200×600
三次构建,一只秒表
在此放入真实截图或渲染图

两款音频产品同时发布,Demo 都足以让产品会议过早进入“选哪一个”的讨论。

阿里巴巴的 Qwen-Audio-3.0-TTS 是面向生产的语音系统,提供 Flash 与 Plus 服务档位,强调多语言、方言、长文本、自然语言表演指令和细粒度标签。字节跳动的 Seed Audio 1.0 把对象扩展到了完整声音场景:一次生成里可以同时组织人声、音效和环境声,还能在时间线上安排对白。

对正在做客服 Agent、多语言引导、游戏角色或产品短片的小团队,两者都值得关注,但它们并不是同一种产品,发布指标回答的也不是同一个问题。低词错率无法证明关门声能卡在镜头切换点;一段完整的 30 秒声音场景,也无法证明对话产品能足够快地播出第一帧声音。

今天应该改变的不是供应商名单,而是验收方式:先写清音频任务,再准备一小组困难 fixture,记录完整交付链路,并把“生成后还要人工修多久”纳入结果。

本文给出的是一套建议执行的 12 次生产验收方案。我们没有调用这两项新托管服务,没有组织听测,也没有复现厂商成绩。文中的阈值和评分字段只是团队建立自有测试时的起点,不是 Y Build 的实测 benchmark。

两款产品发布了什么,又为什么不能放进同一列排名

Qwen-Audio-3.0-TTS 项目页将其描述为一套基于 12.5 Hz 语音 tokenizer 和渐进式训练流程的合成系统。团队称它覆盖 16 种语言、20 个中文方言区域,支持最长三分钟单次合成、86 个细粒度行内标签、自由形式指令,并可通过超分输出 48 kHz 音频;公开评测覆盖内容一致性、说话人相似度、可控性、长文本和受损参考音频。

这项服务不能简单理解为“开源 Qwen3-TTS 换了名字”。阿里云当前的 Model Studio 语音文档列出了托管模型 qwen-audio-3.0-tts-flash,并展示非流式与 SSE 两种输出方式。此前的 Qwen3-TTS 开源仓库可以作为透明基线,但其中可下载的 0.6B/1.7B artifact、语言范围、运行方式和发布时间都不同。不能因为旧系列有权重,就推断新托管模型也已公开权重。

Seed Audio 1.0 官方发布针对的是另一种生产单元。字节称它用共享场景表征联合建模人声、音效和环境声,接受文字与已获授权的参考音频,覆盖 20 多种语言,单次可生成约两分钟并继续延展,还能以 100ms 间隔安排对白。官方称多数评测场景的可用率超过 90%,但页面没有披露足够的任务分布、评审者、对照系统和 API 细节,外部团队不能把 90% 当成自己的预期成片率。

目前能得出的可靠结论很窄,却足够有用:Qwen 的重心是可控的生产语音,Seed 则把生成对象扩大为完整声音场景。重叠任务才适合横向比较;非重叠任务应分别与团队当前的生产流程比较。

六个术语,防止“音质好”掩盖问题

首段可播放音频时间:从客户端发出已被服务接受的请求,到产品收到第一帧可解码、可播放音频的时间。它包含网络、排队、服务端、缓冲和客户端行为。厂商的模型延迟或实验室“首包”不等于用户等待。

实时率(RTF):生成耗时除以输出音频时长。RTF 小于 1 表示生成速度快于播放速度,但无法说明首包是否够快,也看不出后续分片是否抖动。

可懂度:听者能否还原预期文字。用自动转写计算 WER/CER 可以发现问题,但产品名、金额、日期、否定词和验证码等关键 token 必须另设加权或零容错检查。

表演指令遵循:输出是否符合要求的情绪、语速、重音、发音、角色和非语言声音。语句可以完全听懂,却不适合当前场景。

时间对齐:事件起止点是否落在允许窗口。例如“关门声在三秒左右”必须改写成 2.85–3.20s,而不是靠印象判断。

人工修订分钟数:从生成结果到可上线成品之间的人力,包括重试、改文案、移动 cue、裁呼吸声、去噪点、混音、核对发音和审批。它最可能推翻 Demo 阶段的选择。

不要把六项压成一个没有解释的“综合质量分”。对话语音可能愿意牺牲一点自然度偏好来换取明显更快的响应;品牌短片可以接受慢生成,却不能接受产品名读错一次。

从两个任务开始,而不是从两个模型名开始

设想一个三人 SaaS 团队正为国际发布准备两类音频。

第一类是产品内设置引导。用户连接数据源后,系统会朗读短而动态的操作提示。它必须快速开始,准确读出账户字段,处理中英日三种文字,而且绝不能因漏掉否定词,把警告说成鼓励。

第二类是 30 秒发布短片。片中有一位旁白,7.5 秒出现通知音,14 到 15 秒之间关门,结尾场景有轻微雨声,本地化收尾台词必须在 Logo 出现前结束。现有基线是分别制作人声、音效和环境声,再由人工编辑时间线。

这样就形成两个独立问题:

  1. 托管语音模型能否改善设置引导,同时不增加体感等待与发音风险?
  2. 统一音频模型能否减少短片的拼装与返工,同时保持时间精度和可编辑性?

Qwen-Audio-3.0-TTS 应进入第一个对比,也可以测试第二个任务的旁白部分。Seed Audio 应进入第二个对比;若接口支持,也可进入语音子任务。产品不需要的能力不应加分。

12 次运行的 fixture 包

准备四类 fixture,每类独立生成三次。三次不足以建立置信区间,但足以暴露“好 Demo 是否只是抽中一次好样本”。同一轮比较中,固定模型版本、服务区域、API 模式、音色、采样参数、输入、参考素材与后处理。

类别Fixture难点通过证据
A. 对话启动20 秒设置提示,包含动态账户名首段延迟、动态文本、自然停顿客户端首段音频 trace;账户名准确;抖动不越线
B. 关键语言中英日警告,包含日期、金额、否定词、缩写和产品名平均 WER 会掩盖不等价的伤害关键 token 零错误;完整转写;母语审稿通过
C. 定向表演同一音色分别说中性、紧急、安抚台词测试控制力,同时要求身份稳定盲测成对选择;音色连续;情绪不过度
D. 声音场景30 秒对白、通知、关门、雨声和 Logo 截止点组合、事件定位、混音、可编辑性cue 窗口台账;对白转写;返工分钟;导出格式

每类使用 010203 三次运行,因此每个候选配置有 12 条观察。供应商若提供 Flash 和 Plus,应视为两个独立配置,不能先平均。统一场景模型若无法导出分轨,也要记录为生产限制,不能只交给编辑一个混音文件就宣称任务完成。

文本要接近真实生产:包含标点、数字、缩写、外来词、多音词和产品确实会出现的名称。参考声音必须有可追溯授权。不要为了“更真实”,上传一段随手找到的员工、客户、名人或抓取声音。

一张可由别人复核的运行卡

每个生成文件旁边保存一张运行卡。它不是形式主义,而是防止“获胜样片”与生成它的配置脱钩。

audio_fixture_run:
  fixture_id: "B-critical-language-ja"
  run: "02"
  candidate: "provider/model/version-or-tier"
  region: "记录确切服务区域"
  api_mode: "streaming|non-streaming|scene"
  requested_at_utc: ""
  first_playable_audio_ms: null
  completed_audio_ms: null
  output_duration_ms: null
  critical_tokens:
    expected: ["7 月 31 日", "$29", "请勿断开连接", "YBuild"]
    observed: []
  event_windows: []
  transcript_url: ""
  audio_hash: ""
  model_response_id: ""
  retries: 0
  provider_cost: null
  repair_minutes: null
  rights_receipt: "voice-rights/fixture-speaker-01.md"
  reviewer_decision: "pass|repair|reject"
  reviewer_notes: ""

用完整耗时与输出时长计算 RTF,同时保留原始时间戳。保存原始响应、文件 hash、失败与重试。供应商若静默更新 latest 别名,未来回归才不会被误判为审稿者标准变化。

实验结果不是一首最喜欢的 MP3,而是一个文件夹:输入、运行卡、生成音频、转写、cue 台账、听测决定、授权凭证和一份简短的上线决定。

听测要围绕任务和错误,而不是一个“整体感觉”分数

MOS 常见,是因为听者可以用五分量表评价自然度或质量。设计得当时它仍有价值,但不应成为唯一门槛。Practical & Contextual Speech Synthesis Evaluation 主张使用带错误类型与业务严重度的时间标注,因为脱离语境的自然度分数无法告诉团队到底哪里坏了。近期一项声音重建评测框架也指出,标准自然度与相似度指标对真实任务中的取舍可能不够敏感。

听测分两轮。

第一轮隐藏供应商和模型名。对重叠输出,每次只问一个成对问题:哪个更适合作为对话开场、哪个保留了安抚感、哪个产品名更清楚、哪个场景更贴合时间线。Google 关于 MOS 与 A/B 测试的复现实验发现,A/B 对系统比较更可靠,同时提醒两类测试的标准误都可能被低估。小型内部评审只应报告票数和分歧,不要制造统计确定性。

第二轮让评审看到脚本和任务,按固定分类标记带时间戳的错误:漏词、错词、关键 token 错误、说话人错误、身份漂移、不自然停顿、开头截断、意外非语言声、时间错位、环境声遮蔽、音频伪影、情绪偏差或权利风险。严重度分为外观问题、可修和阻断。

如果要招募远程听者,ITU-T P.808 给出了众包语音质量测试的材料、实验设计与流程。几个同事戴着未知耳机给分,属于有价值的用户反馈,但不能包装成符合标准的正式听测。

把交付链路与声音场景分开测

对话语音必须在客户端埋点:请求被接受、首字节、第一帧可解码音频、播放开始、每个分片到达、播放断流、完成、取消与重试。测试用户真实所在区域和网络。阿里云文档表明新模型可使用非流式或 SSE 接口,但“接口存在”并不能证明你的产品延迟达标。

声音场景则需要 cue 台账:

Cue目标窗口实际起止容差结果返工
旁白第一句0.0–6.8s±150ms
通知音7.35–7.65s±150ms
关门声14.0–15.0s±250ms
雨声底18.0–29.2s±400ms
最后一个词结束29.4s 之前硬门槛

时间可控音频研究并不只评主观音质。ControlAudio 同时报告事件级和片段级时间指标、音频分布指标、CLAP 相关性、WER、MOS 与 RTF。小团队无需复刻整套研究工具,真正该借鉴的是多维设计:一段悦耳样片仍可能在文字、cue 或运行约束上失败。

音频进入真实流程后,还要增加下游结果。设置引导可观察完成、重播、跳过、中断和客服升级;发布短片应先看评审接受率与最终剪辑耗时,再讨论互动数据。若每条生成音频都要人工修 25 分钟,模型只是提高了产量,并没有自动化任务。

顺滑 Demo 不会展示的失败模式

平均可懂度很好,关键 token 却错了。 整段转写即便 98% 正确,也可能把 $29 说成 $99,把“请勿重连”说成“请重连”,或把产品名念成竞品。关键 token 应单独零容错。

第一段很快,后续却卡顿。 服务可能优化首包,但后续分片不均。除首响外,还要记录断流与最大分片间隔。

表现力变成不稳定。 情绪指令可能同时改变语速、发音、年龄感或说话人身份。同一音色必须跨中性、紧急和安抚台词测试,预先定义哪些属性不能变。

对白可控不等于整条音轨可控。 Seed 发布页明确说当前时间控制主要聚焦角色对白,更细的其他声音控制仍属后续方向。每个必要 cue 都要单独测,不能从对白时间功能外推到音效与环境声。

单一混音文件让后续无法编辑。 场景听起来完整,但法务要求删一句、本地化结尾要加长时,可能只能整段重做。记录分轨能力、局部重生成范围,以及小改一处能否保持其他部分不变。

长音频会漂。 两分钟音频或延展接缝处可能出现身份、空间感、响度、语言或节奏变化。固定检查点与接缝位置,不能只听开头。

服务边界会变。 区域、配额、价格、数据保留、模型别名与限流都是产品的一部分。当前 Qwen 托管接口文档包含区域限制,必须核实自己的账户究竟能使用哪个区域与数据路径。

声音权利与数据处理必须是发布门槛

生成技术改变了 artifact,却不会自动创造使用许可。每个 fixture 开跑前,附上声音权利凭证:声音来源、本人或授权方、允许用途、地域、期限、撤回路径,以及是否允许衍生和跨语言表演。

把声音分为三类:

  • 由公开服务条款覆盖的供应商预置声音;
  • 团队未提交真人参考、只通过描述设计的合成声音;
  • 由已获授权录音克隆或适配的声音。

第三类控制最严格。限制注册权限,审核具体参考材料,把生成的声音资产绑定到负责人和使用策略,并让删除可验证。允许发布一段原始录音,不等于允许同一身份合成其他语言、情绪、产品或政治内容。

还要记录脚本、参考音频和输出的保存与训练政策、账户访问、日志、删除和事故联系人。供应商没有回答的字段就写“未知”。未知是决策输入,不能靠乐观猜测补全。

按任务签署上线矩阵

对话语音和完整声音场景分别评分。先过硬门槛,再比较偏好。

维度对话引导发布短片门槛或偏好
关键 token 准确3 次运行零错误对白零错误硬门槛
首段可播放音频不超过产品上限非主要指标对话硬门槛
播放连续性不超过断流限制离线导出不适用硬门槛
Cue 对齐不适用必要 cue 均在容差内硬门槛
权利凭证完整每个声音与参考均完整硬门槛
返工时间每条接受音频的中位分钟数每个接受场景的中位分钟数有上限的偏好
听者偏好针对任务的 A/B 票数针对任务的 A/B 票数偏好
成本含重试的每条接受音频含返工的每个接受场景偏好
可编辑性可安全重做单句分轨或可控局部修改产品要求
重复性展示三次运行差异展示三次运行差异不稳定则暂停

上线的是一个配置,而不是一个品牌。决定中必须写明模型或档位、区域、API 模式、音色、参数、fixture 版本、批准用途、fallback 与复审日期。

决定只有四种:

  • Go:硬门槛全部通过,返工低于上限,声音权利与数据问题均已解决。
  • Limited go:仅一个窄任务通过,其他语言、声音或场景仍禁止。
  • Hold:能力值得继续看,但重复性、条款、可编辑性或指标不完整。
  • No-go:关键 token、权利、时间或可靠性门槛失败,现有流程无法隔离风险。

Fallback 也必须可执行。对话语音要有缓存或本地安全提示、文字显示和取消行为;创意场景要保留现有多轨制作路径。“重试到听起来不错”为止不是 fallback,而是无上限成本与选择偏差。

这套方案适合什么,又不能证明什么

当音频影响用户任务、品牌身份、本地化、可访问性、叙事时间或客服负担时,可以使用这套 fixture 包。它刻意控制在小团队接入新供应商前能执行的规模。

它不是临床可懂度研究、无障碍认证、法证说话人验证、跨语言公平研究,也不能证明某供应商领先市场。12 次运行无法估计罕见失败;内部小组不能代表所有口音、方言、听力状况、设备和文化理解。自动 WER 也会继承转写模型本身的错误与偏差。

两次发布仍留下重要未知。Seed 公开页没有提供开放 checkpoint、完整技术报告、分轨契约,也没有足够细节让外部复现“可用率”;Qwen 项目页报告了广泛结果,但托管服务仍需账户级核实价格、配额、区域、隐私与别名行为。厂商 leaderboard 与 MOS 是对其测试的证据,不是你的上线结果。

如果产品只需十条固定无障碍提示,经过审核的真人录音库可能更简单、更安全、更便宜。如果每个场景最终都由专业声音设计师处理,就把 AI 定位为草稿来源,并评估节省了多少时间,不要假装成品已经全自动。

48 小时 Build Lab 执行计划

第 0–4 小时: 写下两个音频任务、关键 token、cue 窗口与现有基线,补齐声音权利凭证。团队若说不清参考声音由谁授权,立即停止。

第 4–8 小时: 准备四类带版本的 fixture、客户端埋点、运行卡和盲测文件命名。任何人开始听之前,冻结文本与参数。

第 8–16 小时: 每类 fixture、每个候选配置生成三次。记录失败、重试、原始时间、响应 ID、成本与 hash,不删除坏样本。

第 16–24 小时: 进行盲化 A/B 听测与带时间戳错误标注。每个上线语言由母语评审检查关键 token 和语用是否自然。

第 24–36 小时: 只做真实流程允许的修订,记录分钟数和工具。专门测试一次小改动,确认能否只换一句而不重做全部 artifact。

第 36–44 小时: 汇总通过次数、每条接受输出成本、返工时间、cue 偏差和三次运行的波动。把已证实观察、厂商主张与未知项分开。

第 44–48 小时: 针对每个任务签署 go、limited-go、hold 或 no-go;保存 fallback,并设定模型别名、条款、价格、区域或产品脚本变化时的复测触发器。

最后的可靠结论可能是:Qwen 适合交互语音,Seed 适合创意初稿,现有流程仍应负责最终成片,或者两者都暂时不过关。这不是“没有测出结果”,而是在用户和编辑承担成本之前,找到了产品边界。

References

  1. Qwen Audio:Qwen-Audio-3.0-TTS
  2. 阿里云 Model Studio:非实时语音合成
  3. QwenLM:Qwen3-TTS 开源仓库
  4. 字节跳动 Seed:Seed Audio 1.0 音频创作模型
  5. Dinkel 等:ControlAudio
  6. Pine 等:Practical & Contextual Speech Synthesis Evaluation
  7. Sanchez 等:An Evaluation Framework for Text-to-Speech Voice Reconstruction
  8. Ribeiro 等:MOS vs. AB
  9. ITU-T P.808:众包语音质量主观评测
  10. Hu 等:Automatic Evaluation of Speaker Similarity
喜欢这篇拆解?
新实验上线当天就送到你邮箱。每周一封,附原始数据。
作者
Maya Chen YBuild Blog 产品体验编辑

Y Build 使用的编辑笔名,主要负责用户研究、产品体验、转化与留存相关的现场笔记。

作者 · 实验室
更多来自 Maya →

继续阅读

查看全部实验 →
构建你自己的应用
免费 · 无需信用卡
免费开始 →