来源:GitHub (★327)
URL: https://github.com/5uck1ess/tts-bench
精读日期:2026-09-16
模型:DeepSeek V4 Flash(AI 生成,人工未审校)
正文获取:全文
一、核心论点/事实
- tts-bench 是一个本地 TTS 模型基准测试项目,覆盖 Windows/Linux/Mac 三平台,从三个维度评测:速度(RTFx,实时倍速)、内存、以及主观听感。
- 速度基准覆盖 CPU / CUDA / Apple Silicon,提供冷启动/热启动 TTFA、RTFx、内存占用,按硬件分榜(Ryzen 9 9950X3D + RTX 5090、Apple M4、Ryzen + RTX 3090)。
- 客观指标包含三项:UTMOS(自然度)、WER(可懂度)、SIM(克隆保真度),通过 ASR + 说话人验证打分,支持 Default/Cloning 切换与排序。
- 主观质量以公开盲测 A/B 竞技场为 ground truth:两段音频、不显示模型名、无需登录、约 5 秒一票;克隆排名冻结于 397 票、覆盖 28 个克隆模型。
- 原型的客观质量分 NAQ 被撤下,原因是 v2 特征与主观排名相关性不够,正在重新设计;当前 bench 只测速度,质量靠"听"。
- 全量安装磁盘占用很大(文中未给出具体数字),单模型体积小得多,支持按模型名部分安装;安装约 10-15 分钟,需 Python 3.11。
- 部分模型有平台限制:Voxtral 为 Mac(MLX,仅预设音色)+ Linux(vLLM,克隆);Fish S2-Pro / MetaVoice / Step-Audio-EditX / Higgs Audio v3 / dots.tts / Zonos2 / Orpheus / CosyVoice 3 仅 Linux(CUDA);DramaBox 需约 18 GB VRAM。
二、方法/架构拆解
- 三个评测视角(Lenses):Listen(听感,内联播放器,每模型×每 prompt)、Speed(分硬件榜)、Scores(客观指标)。
- 音频样本与硬件解耦:每个样本只从最高保真度的机器采集一次,并标注来源,保证跨设备可比。
- 模型分类:预设音色模型(权重内置固定/可选说话人)与零样本克隆模型(推理时给参考音频);无参考时零样本模型回退到内置样本(本 bench 使用 house sample),因此其"默认音色"实为对该片段的克隆。少数模型两者兼具(如 Voxtral 有 20 个预设)。
- 克隆支持三种参考格式:仅 wav / wav + 转写 / HF-gated wav;命令为
python bench.py --reference reference/myvoice.wav。 - 情绪/表达控制能力被单独标注为四类:自然语言指令、数值/预设参数、依赖独立参考片段或情绪向量、无。
- 公平性设计:bench 对所有模型喂相同 plain prompt,因此上述情绪控制特性不参与任何评分。
- 注册但未完整评测的模型:Qwen3-TTS 0.6B CustomVoice(9 个预设音色)已注册并冒烟测试但带 caveat;1.7B Base 因无模型原生预设音色,无参考时克隆 house sample,只出现在 Cloning 榜。
- 已知缺陷:某模型克隆功能因间歇性解码失控被禁用——相同输入一次产出 12.9 秒音频,下一次产出 655.3 秒。
三、值得注意的局限/争议
- 作者承认:NAQ 客观质量分被撤下,因 v2 特征与主观排名相关性不足,正在重新设计;当前无客观排名。
- 作者承认:盲测克隆排名衡量的是"音色匹配度",而非"整体克隆质量"——以音色为中心的 A/B 投票不会惩罚其他缺陷,应读作"最佳音色匹配"而非"最佳克隆"。
- 作者承认:bench 对所有模型使用相同 plain prompt,因此情绪/表达控制等特性未被任何评分覆盖。
- 作者承认:部分模型存在平台/依赖限制(仅 Linux、需特定 CUDA/torch 版本、无 Blackwell Windows 路径等),影响可复现性。
- AI 判断:主观盲测的 ground truth 依赖投票量,克隆排名冻结在 397 票,样本量偏小,排名稳定性存疑。
- AI 判断:速度榜按具体硬件分列,跨榜不可直接比较;"选你实际拥有的机器"这一设计虽实用,但削弱了统一横向对比。
- AI 判断:解码失控(12.9s vs 655.3s)这类间歇性故障说明部分模型的推理稳定性尚未达标,评测结果可能不可复现。
四、与 RRLab 研究的关联
- Harness 工程:tts-bench 的"按模型名部分安装 + 仅运行 venv 存在的模型"设计,是典型的可增量扩展评测 harness,可直接借鉴到 RRLab 的模型评测流水线。
- 模型评测:三视角(听感/速度/客观指标)分离、且明确区分"主观 ground truth"与"客观 backstop"的评测哲学,对 RRLab 构建多维度评测体系有直接参考价值。
- 模型评测:NAQ 因与主观排名相关性不足而被撤下的案例,是"客观指标必须与人类偏好对齐验证"的负面教材,提醒 RRLab 在引入自动评分时先做相关性校验。
- 多模型协同:模型按预设音色/零样本克隆分类、并标注情绪控制能力四档,为 RRLab 做模型能力矩阵与路由选择提供了结构化标签范式。
- Agent 落地:盲测竞技场(无登录、5 秒一票、实时更新排名)是一种低成本人类反馈采集机制,可迁移到 RRLab 的 Agent 输出质量众包评估。
- AI 原生产品:音频样本与硬件解耦、标注来源、单一播放等交互细节,是评测类产品体验设计的可复用模式。
本笔记由 DeepSeek V4 Flash 自动生成,未经人工审校。原文链接:https://github.com/5uck1ess/tts-bench