Hume AI 刚开源了一个叫 TADA 的语音合成模型,有几个数据挺硬的。
这是什么
TADA 是 Text-Acoustic Dual Alignment 的缩写,核心思路是把文本和语音做一对一绑定。传统 TTS 系统里,1 秒音频对应 12-75 个 token,而 TADA 只用 2-3 个。开源了 1B 参数的英文模型和 3B 参数的多语言模型,MIT 协议。
GitHub: GitHub - HumeAI/tada: Open Source Speech Language Model · GitHub
Hugging Face: HumeAI/tada-1b · Hugging Face
为什么我觉得值得发
速度是真的快。 实时因子 0.09,比同类 LLM-TTS 快 5 倍以上。原因很简单:token 少了,计算量就下来了。
零幻觉是硬指标。 在 LibriTTS-R 的 1000+ 测试样本里,内容幻觉率为零。这个对生产环境很关键——你不想让 AI 助手突然开始胡说八道。
能跑在手机上。 模型够轻,边缘设备能跑。这个打开了低延迟、隐私友好、不依赖云 API 的可能性。
长音频支持。 2048 token 的上下文窗口,传统 TTS 大概能撑 70 秒,TADA 能撑 700 秒左右。这个差距来自 token 对齐方式。
适合谁
- 做语音助手的,想降低 API 成本或者做端侧部署
- 需要长音频合成的,比如有声书、播客
- 对可靠性有要求的场景,医疗、金融、教育这些不能容忍幻觉的地方
- 想自己 fine-tune 语音模型的开发者
我自己的判断
优点说完,也得说限制。
长音频有说话人漂移的问题——超过 10 分钟有时候会变声。论文里提到了 Speech Free Guidance (SFG) 技术来缓解,但没完全解决。所以如果是超长内容,可能需要分段或者重置上下文。
另外这个模型是预训练的,针对助手场景还需要 fine-tune。如果你想做对话式语音助手,不能拿来直接用。
开源归开源,论文也在 arXiv 上 (2602.23068),但要上手还是需要 PyTorch、GPU 推理这些基本功。不是开箱即用的那种。
链接
- GitHub: GitHub - HumeAI/tada: Open Source Speech Language Model · GitHub
- 1B 英文模型: HumeAI/tada-1b · Hugging Face
- 3B 多语言模型: HumeAI/tada-3b-ml · Hugging Face
- 在线 Demo: TADA - a Hugging Face Space by HumeAI
- 论文: [2602.23068] TADA: A Generative Framework for Speech Modeling via Text-Acoustic Dual Alignment
讨论
你们在做语音相关项目吗?TTS 这块目前用的是什么方案?这个零幻觉的特性对你来说重要吗?