Awesome multilingual OCR toolkits based on PaddlePaddle
Contexts Optical Compression
OCR expert VLM powered by Hunyuan's native multimodal architecture
Accurate × Fast × Comprehensive
Visual Causal Flow
Repo of Qwen2-Audio chat & pretrained large audio language model
Qwen3-Coder is the code version of Qwen3
Infinite Worlds with Versatile Interactions
Official inference repo for FLUX.2 models
A Powerful Native Multimodal Model for Image Generation
MOSS‑TTS Family open‑source speech and sound generation model
Official code for Style Aligned Image Generation via Shared Attention
Code release for ConvNeXt V2 model