Tokenizer-Free TTS for Multilingual Speech Generation
Open-source multi-speaker long-form text-to-speech model
High-Quality Voice Cloning TTS for 600+ Languages
ComfyUI integration for Microsoft's VibeVoice text-to-speech model
An Open Source text-to-speech system built by inverting Whisper
A fast TTS architecture with conditional flow matching
Towards Human-Level Text-to-Speech through Style Diffusion
Multimodal AI Story Teller, built with Stable Diffusion, GPT, etc.