Low-latency REST API for serving text-embeddings
Port of OpenAI's Whisper model in C/C++
Serve, optimize and scale PyTorch models in production
Simplifies the local serving of AI models from any source
The Triton Inference Server provides an optimized cloud
Deep Learning API and Server in C++14 support for Caffe, PyTorch
Unified Model Serving Framework
Openai style api for open large language models