来源:GitHub (★703)
URL: https://github.com/Ampixa/sanoTTS
精读日期:2026-09-17
模型:DeepSeek V4 Flash(AI 生成,人工未审校)
正文获取:全文

一、核心论点/事实

  • sanoTTS 是一个约 1.4M 参数的神经 TTS,可在约 3 美元的 ESP32-S3 芯片或浏览器中运行,在 sub-15M 参数级别中 SCOREQ/UTMOS 指标领先。
  • 在 ESP32-S3 上实现实时合成,比实时快 2.6 倍(使用 Xtensa LX7 SIMD 内核);同一板上的标量 C 版本为 1.58,即慢于实时。
  • 模型体积:int8 为 337 KB(heart-nano),fp16 约 3 MB,fp32 为 5.5-8.7 MB;零依赖(内置 espeak-ng 音素化器)。
  • 支持 13 种语言、27 个语音包;Nepali、Hindi、Chinese 目前仅限浏览器端。
  • 各语言约 1.56M 参数,其中 8 个语言另有约 511k 参数变体。
  • Whisper 词错误率(WER)在域外文本上为 0.038(葡萄牙语)到 0.392(罗马尼亚语),基于每语言 16 句的可懂度测试,非自然度,且未进行听感测试。
  • 浏览器端完全客户端运行(WebAssembly,无服务器),gzip 后约 700 KB;Kokoro 参数量为最大语音(heart,2.27M)的 36 倍,为最小语音的 279 倍。

二、方法/架构拆解

  • 架构:纯 numpy 推理,无 torch、无 onnxruntime;包含 CLI + 库;浏览器端使用 espeak-ng-in-WASM 音素化器 + 各语音自有神经栈。
  • 实现要点
  • 语音包首次使用时下载,浏览器端下载后将 fp16 扩展为 fp32 并校验 sha256。
  • 浏览器端 wasm 运行时 gzip 后约 700 KB(espeak-ng G2P 未压缩约 2.5 MB,gzip 后约 660 KB;声学/解码器 wasm 另加约 40 KB)。
  • 质量主要取决于解码器:解码器从 1.09M 增至 1.84M 参数可显著提升质量。
  • 基准与评测
  • 使用 24 句多样化测试集,采用无参考指标套件(SCOREQ / UTMOS 为自然度预测器,DNSMOS-SIG 为信号质量,越高越好)。
  • 参数计数为推理时参数;已发布文件大小:sanoTTS amy 2.8 MB fp16,TinyTTS 3.5 MB fp16,Kokoro 约 330 MB fp32。
  • 在 DNSMOS-SIG 上,TinyTTS 以 0.01 优势领先;Kitten TTS 参数量为 10 倍但 SCOREQ 低整整 1 分。
  • 证据文件:experiments/evidence/ood-tatoeba-20260908.json。

三、值得注意的局限/争议

  • 作者承认的
  • WER 仅衡量可懂度(基于每语言 16 句),不衡量自然度,且未进行听感测试。
  • fp32 模型未转换为 fp16,仅因已发布输出为 fp32 输出。
  • 与 Kokoro(82M,60 倍大)的差距不声称能弥补,前沿模型仅在约 15M 级别才拉开差距。
  • 无单一指标能说明全部问题(如 DNSMOS-SIG 上 TinyTTS 略优)。
  • AI 判断的
  • 评测集规模较小(24 句),统计显著性存疑。
  • 浏览器端 fp16 扩展为 fp32 可能引入精度损失或性能开销,尽管有 sha256 校验。
  • 多语言支持中部分语言仅限浏览器,可能限制嵌入式场景的通用性。
  • 未提及训练数据来源、训练成本及伦理考量(如语音克隆风险)。

四、与 RRLab 研究的关联

  • Harness 工程:可借鉴其零依赖、纯 numpy 推理的轻量级部署思路,以及浏览器端 WASM 客户端运行模式,适合边缘设备或隐私敏感场景的 Harness 设计。
  • 多模型协同:sanoTTS 与 Kokoro、TinyTTS 等不同规模模型的对比,为多模型协同中的模型选择与路由提供参考(如按设备能力动态选择语音包)。
  • 模型评测:其无参考指标套件(SCOREQ/UTMOS/DNSMOS-SIG)与 WER 结合的多维度评测方法,可借鉴到 RRLab 的模型评测体系中,强调可懂度与自然度的区分。
  • Agent 落地:极低资源占用(337 KB int8)和实时性(2.6 倍实时)使其适合作为 Agent 的语音输出模块,尤其在嵌入式或浏览器端 Agent 场景。
  • AI 原生产品:浏览器端完全客户端运行、无服务器、无上传的特性,为 AI 原生产品的隐私保护和低延迟交互提供了范例;其语音包懒加载和 sha256 校验机制可借鉴到产品工程中。

本笔记由 DeepSeek V4 Flash 自动生成,未经人工审校。原文链接:https://github.com/Ampixa/sanoTTS