Hume AI 开源 TADA:5倍速零幻觉 TTS,能在手机跑

Hume AI 刚开源了一个叫 TADA 的语音合成模型,有几个数据挺硬的。

这是什么

TADA 是 Text-Acoustic Dual Alignment 的缩写,核心思路是把文本和语音做一对一绑定。传统 TTS 系统里,1 秒音频对应 12-75 个 token,而 TADA 只用 2-3 个。开源了 1B 参数的英文模型和 3B 参数的多语言模型,MIT 协议。

GitHub: GitHub - HumeAI/tada: Open Source Speech Language Model · GitHub
Hugging Face: HumeAI/tada-1b · Hugging Face

为什么我觉得值得发

速度是真的快。 实时因子 0.09,比同类 LLM-TTS 快 5 倍以上。原因很简单:token 少了,计算量就下来了。

零幻觉是硬指标。 在 LibriTTS-R 的 1000+ 测试样本里,内容幻觉率为零。这个对生产环境很关键——你不想让 AI 助手突然开始胡说八道。

能跑在手机上。 模型够轻,边缘设备能跑。这个打开了低延迟、隐私友好、不依赖云 API 的可能性。

长音频支持。 2048 token 的上下文窗口,传统 TTS 大概能撑 70 秒,TADA 能撑 700 秒左右。这个差距来自 token 对齐方式。

适合谁

  • 做语音助手的,想降低 API 成本或者做端侧部署
  • 需要长音频合成的,比如有声书、播客
  • 对可靠性有要求的场景,医疗、金融、教育这些不能容忍幻觉的地方
  • 想自己 fine-tune 语音模型的开发者

我自己的判断

优点说完,也得说限制。

长音频有说话人漂移的问题——超过 10 分钟有时候会变声。论文里提到了 Speech Free Guidance (SFG) 技术来缓解,但没完全解决。所以如果是超长内容,可能需要分段或者重置上下文。

另外这个模型是预训练的,针对助手场景还需要 fine-tune。如果你想做对话式语音助手,不能拿来直接用。

开源归开源,论文也在 arXiv 上 (2602.23068),但要上手还是需要 PyTorch、GPU 推理这些基本功。不是开箱即用的那种。

链接

讨论

你们在做语音相关项目吗?TTS 这块目前用的是什么方案?这个零幻觉的特性对你来说重要吗?