A 2.78-trillion-parameter Kimi K3 running inference on a single CPU
Gemma 4 26B-A4B inference in ~2 GB of RAM on any M-series MacBook
FlashMLA: Efficient Multi-head Latent Attention Kernels
An expressive, efficient attention architecture
Run GLM-5.2 (744B MoE) on a 25GB-RAM consumer machine
Run the full 2.78-trillion-parameter Kimi K3 model
Advancing Open-source World Models
Open agentic coding model optimized for local deployment
High-performance MoE model with MLA, MTP, and multilingual reasoning