Port of Facebook's LLaMA model in C/C++
Open-source large language model family from Tencent Hunyuan
MiniMax H3 inference engine for Mac computers
Foundational Models for State-of-the-Art Speech and Text Translation
Clean and efficient FP8 GEMM kernels with fine-grained scaling
FlashMLA: Efficient Multi-head Latent Attention Kernels