Audio Language Models are Few-Shot Learners
A text-to-speech, speech-to-text and speech-to-speech library
Open-source framework for intelligent speech interaction
Oobabooga - The definitive Web UI for local AI, with powerful features
Multi-modal large language model designed for audio understanding
MiniMax H3 is a general-purpose, omni-modal generative system
Large Audio Language Model built for natural interactions
The official Python library for the Fish Audio API
Official Python inference and LoRA trainer package
The open-source voice synthesis studio powered by Qwen3-TTS
Pushing the Frontier of Long Audio-Visual Generation
A Family of Open Sourced Music Foundation Models
Transforming Multimodal Content into Captivating Multilingual Audio
Streaming Real-time Audio-Driven Avatar Generation
MiniMax H3 inference engine for Mac computers
AI video generator optimized for low VRAM and older GPUs use
Tokenizer-Free TTS for Multilingual Speech Generation
Miso TTS is an 8 billion, highly emotive text-to-speech model
MOSS-TTS-Nano is an open-source multilingual tiny speech generation
TTS model capable of streaming conversational audio in realtime
MOSS‑TTS Family open‑source speech and sound generation model
Taming Stable Diffusion for Lip Sync
Generate music based on natural language prompts using LLMs
Foundational video generation model with 13.6B parameters
Implementation of AudioLM audio generation model in Pytorch