Best LLM Inference AI Agents (2026)

Our top 17 LLM Inference AI agents, ranked by how actively they're maintained. See all 17 LLM Inference agents.

1
2
3
e
LLM Inference

exllama is a highly optimized implementation of the Llama language model for inference, specifically designed to work ef...

View Details Visit
4
F
LLM Inference

FastChat is an open-source platform for serving and interacting with multiple large language models (LLMs) efficiently. ...

View Details Visit
5
6
I
LLM Inference

Infinity is a Python-based tool designed for efficient text-embedding inference, enabling users to generate embeddings l...

View Details Visit
7
L
LLM Inference

Liger-Kernel provides optimized Triton kernels for efficient large language model (LLM) training, focusing on performanc...

View Details Visit
8
L
LLM Inference

LMDeploy is a high-performance inference and serving framework designed for large language models (LLMs) and vision-lang...

View Details Visit
9
M
LLM Inference

MInference is an open-source tool designed to optimize the inference process of long-context large language models (LLMs...

View Details Visit
10
m
LLM Inference

mistral.rs is a Rust-based implementation for efficient inference of Mistral language models, focusing on high performan...

View Details Visit
11
p
LLM Inference

prima.cpp is a distributed implementation of llama.cpp designed to enable efficient inference of large language models (...

View Details Visit
12
S
LLM Inference

SGLang is an open-source framework designed for efficient serving of large language models (LLMs) and vision language mo...

View Details Visit
13
S
LLM Inference

SkyPilot is an open-source framework for running large language models (LLMs) and batch jobs across multiple cloud provi...

View Details Visit
14
T
LLM Inference

TensorRT-LLM is an open-source library by NVIDIA designed to optimize and accelerate inference for large language models...

View Details Visit
15
16
T
LLM Inference

TGI (Text Generation Inference) is a toolkit designed for deploying and serving Large Language Models (LLMs) efficiently...

View Details Visit
17
v

vLLM

OSS
LLM Inference

vLLM is a high-performance inference engine designed for large language models (LLMs), optimized for throughput and memo...

View Details Visit