Tensor search for humans
A high-throughput and memory-efficient inference and serving engine
A lightweight vLLM implementation built from scratch
Mooncake is the serving platform for Kimi
Ongoing research training transformer models at scale
A course of learning LLM inference serving on Apple Silicon
CV, NLP, LLM project applications, and advanced engineering deployment
Large-language-model & vision-language-model based on Linear Attention
llama.go is like llama.cpp in pure Golang
An ecosystem of Rust libraries for working with large language models