Low-latency REST API for serving text-embeddings
A high-throughput and memory-efficient inference and serving engine
A high-performance ML model serving framework, offers dynamic batching
Unified Model Serving Framework
Library for serving Transformers models on Amazon SageMaker
Toolkit for allowing inference and serving with MXNet in SageMaker