Build AI-powered semantic search applications
A python tool that uses GPT-4, FFmpeg, and OpenCV
HunyuanVideo: A Systematic Framework For Large Video Generation Model
Large Multimodal Models for Video Understanding and Editing
A GPT-4o Level MLLM for Vision, Speech and Multimodal Live Streaming
Official PyTorch Implementation
Open-source Video Translation Skill
Build multimodal AI applications with cloud-native stack
LLM Large Model of Selling Anchor
Context data platform for building observable, self-learning AI agents
MARS5 speech model (TTS) from CAMB.AI
Build cross-modal and multimodal applications on the cloud
Chat & pretrained large audio language model proposed by Alibaba Cloud
Foundational model for human-like, expressive TTS
A Conversational Speech Generation Model
Synchronized Translation for Videos
One-click deployment (including offline integration package)
SoundTranscriber can be used to generate automatic transcription / aut
Edge TTS Desktop turns text into speech through edge-tts.
Two Integrated Text To Speech Engines uses MMS & Silero
Audiocraft is a library for audio processing and generation
Unlimited, private and free Speech-To-Text program
An opinionated CLI to transcribe Audio files w/ Whisper on-device
Ainee - AI Notetaking and Learning Companion
High-quality multi-lingual text-to-speech library by MyShell.ai