来源:GitHub (★294)
URL: https://github.com/5uck1ess/tts-bench
精读日期:2026-08-29
模型:DeepSeek V4 Flash(AI 生成,人工未审校)
正文获取:全文
一、核心论点/事实
- tts-bench 是一个本地 TTS 模型基准测试工具,支持 Windows/Linux/Mac,从速度(实时倍率)、内存、硬件(CPU/CUDA/Apple Silicon)三个维度评测模型。
- 基准包含 28 个克隆模型,盲测投票冻结于 397 票,作为人类偏好 ground truth。
- 客观指标包括 UTMOS(自然度)、WER(可懂度)、SIM(克隆保真度),通过 ASR + 说话人验证计算。
- 原型客观质量分 NAQ 已暂停,因 v2 特征与主观排名相关性不足,正在重新设计。
- 硬件基准 rig 包括:Ryzen 9 9950X3D + RTX 5090、Apple M4、Ryzen 9 5900XT + RTX 3090,另有 Linux CPU/CUDA rig 用于 Fish-Speech S2。
- 安装约需 10-15 分钟,Python 3.11;完整模型集磁盘占用很大,但可按需安装子集。
- 评测公平性:所有模型接收相同纯文本提示,模型特有的情感/风格控制功能不参与评分。
二、方法/架构拆解
- 三视角设计:
- Listen(试听):统一画廊,内嵌音频播放器,每个模型 × 每个提示的样本并排展示(克隆样本紧邻参考音频);音频与硬件无关,从最高保真 rig 采集一次并标注来源。
- Speed(速度):按 rig 分类的排行榜,指标包括冷/热 TTFA(首包延迟)、RTFx(实时倍率)、内存,可排序。
- Scores(客观分):UTMOS/WER/SIM 指标,交互式 Top-15 图表,可排序表格,Default/Cloning 切换。
- Arena 盲测:公开盲 A/B 试听,两个片段不显示模型名,用户投票选更优者;另有克隆匹配投票(哪个克隆更接近参考音色),无需登录,约 5 秒/票。
- 安装机制:按模型 slug 选择性安装(如
python bench.py --reference reference/myvoice.wav);bench 只运行已安装 venv 的模型,部分安装可干净评测,后续可增量补充。 - 克隆参考格式:支持三种——仅 wav / wav + 转录文本 / HF-gated wav。
- 模型分类:
- 预设音色模型:权重内嵌固定/可选说话人,无需参考即可发声。
- 零样本克隆模型:推理时合成参考片段的声音;无参考时回退到内置样本(bench 使用该回退),因此其"默认音色"实为该样本的克隆。
- 混合模型(如 Voxtral:20 个预设 + 克隆)。
- 情感/表达控制分级:自然语言指令 / 数值或预设参数 / 参考片段条件化 / 无(克隆模型仅随参考片段表达)。
三、值得注意的局限/争议
作者承认的局限:
- NAQ 客观质量分已暂停,因与主观排名相关性不足,不发布。
- 克隆 A/B 投票衡量的是音色匹配,不惩罚韵律/情感偏差,应读作"最佳音色匹配"而非"最佳整体克隆"。
- 部分模型有已知问题:Qwen3-TTS 0.6B CustomVoice 注册但标记为不稳定;Qwen3-TTS 0.6B Base 的克隆因间歇性解码失控(相同输入一次产出 12.9 秒、下一次 655.3 秒音频)被禁用。
- 部分模型仅限特定平台:Voxtral 仅 Mac (MLX) + Linux (vLLM);Fish S2-Pro / MetaVoice / Step-Audio-EditX / Higgs Audio v3 / dots.tts / Zonos2 / Orpheus / CosyVoice 3 仅 Linux (CUDA);Echo-TTS 和 DramaBox 仅 Windows + Linux CUDA(DramaBox 需 ~18 GB VRAM)。
- 情感/风格控制功能因公平性未在评分中体现。
AI 判断的局限:
- 客观指标(UTMOS/WER/SIM)与人类主观偏好之间的一致性未经验证,作者也承认 NAQ 失败,说明客观代理指标难以完全替代人耳。
- 速度基准依赖特定硬件配置,结果可能无法泛化到其他 GPU/CPU 组合。
- 盲测投票数(397 票)相对模型数量(28 个克隆模型)可能不足以保证统计显著性,尤其对排名中段模型。
- 默认音色与克隆音色的区分对零样本模型存在概念模糊——"默认"实为内置参考的克隆,可能误导用户对模型原生音色的理解。
四、与 RRLab 研究的关联
- 模型评测:tts-bench 的"三视角"设计(试听 + 速度 + 客观分)和盲 A/B 投票机制可直接借鉴,用于 RRLab 的 TTS/语音模型评测体系;其"客观分暂停、以人耳为准"的教训提示评测需以人类偏好为 ground truth。
- Harness 工程:按模型 slug 选择性安装、venv 隔离、部分安装可干净评测的设计,是高效的评测 harness 模式;增量安装机制值得参考。
- 多模型协同:预设音色 / 零样本克隆 / 混合模型的分类法,以及情感控制分级(自然语言 / 数值 / 参考条件 / 无),可为多模型路由和任务分配提供决策依据。
- Agent 落地:TTS 模型的情感/风格控制能力分级对语音 Agent 的交互设计有直接参考价值——明确哪些模型支持自然语言情感指令,可指导 Agent 的 TTS 选型。
- AI 原生产品:Arena 盲测的众包投票模式(无登录、5 秒/票)是低成本获取人类偏好的产品化范式,可用于 RRLab 的模型评测社区或内部工具。
本笔记由 DeepSeek V4 Flash 自动生成,未经人工审校。原文链接:https://github.com/5uck1ess/tts-bench