MOSS-TTS-Nano is an open-source multilingual tiny speech generation
Towards Human-Sounding Speech
Long-form streaming TTS system for multi-speaker dialogue generation
SoTA open-source TTS
Tokenizer-Free TTS for Multilingual Speech Generation
Converts text to speech in realtime
Capable of understanding text, audio, vision, video
TTS model capable of streaming conversational audio in realtime
A nearly-live implementation of OpenAI's Whisper
A TTS model capable of generating ultra-realistic dialogue
A fast TTS architecture with conditional flow matching