Providers

Every inference provider, one gateway.

21 upstreams from frontier labs to specialty silicon. Smart routing picks the best endpoint per request; you keep one API key.

21 of 21 providers
OpenAI
frontier
live

Reference frontier stack. Strong tool-use and structured outputs.

uptime
99.94%
tps
78
ttft
380ms
textvisionaudio
Anthropic
frontier
live

Best-in-class long-form reasoning and coding with Claude 4.x.

uptime
99.96%
tps
82
ttft
320ms
textvision
Google (Gemini)
frontier
live

Multimodal-first with 2M context Gemini 3.x.

uptime
99.92%
tps
118
ttft
180ms
textvisionaudiovideo
xAI
frontier
live

Grok family; strong real-time and web-grounded responses.

uptime
99.7%
tps
95
ttft
260ms
textvision
Mistral
frontier
live

EU-hosted open-weight and closed Large 3.

uptime
99.85%
tps
110
ttft
280ms
textvision
DeepSeek
frontier
live

Best price/quality frontier ratio; strong coding.

uptime
99.6%
tps
140
ttft
210ms
text
Alibaba (Qwen)
frontier
live

Qwen3 family, 1M context, strong multilingual.

uptime
99.8%
tps
128
ttft
240ms
textvisionaudio
Meta (Llama)
open source-host
live

Llama 4 open weights; served across many partner clouds.

uptime
99.9%
tps
165
ttft
150ms
textvision
Together AI
open source-host
live

Broad OSS catalog with dedicated endpoints and fine-tuning.

uptime
99.9%
tps
210
ttft
130ms
textvisionimage
Fireworks
open source-host
live

Low-latency OSS inference with function calling.

uptime
99.92%
tps
245
ttft
110ms
textvisionaudio
Groq
specialty
live

LPU-based ultra-low latency for Llama / Qwen / Mixtral.

uptime
99.7%
tps
780
ttft
40ms
text
Cerebras
specialty
live

Wafer-scale inference; fastest tokens/sec for Llama-70B class.

uptime
99.6%
tps
950
ttft
35ms
text
SambaNova
specialty
live

RDU inference for large OSS models with enterprise SLAs.

uptime
99.8%
tps
520
ttft
60ms
textvision
AWS Bedrock
hyperscaler
live

Enterprise controls, PrivateLink, HIPAA/FedRAMP.

uptime
99.95%
tps
90
ttft
350ms
textvisionimage
Azure OpenAI
hyperscaler
live

OpenAI models with Azure compliance and quota controls.

uptime
99.95%
tps
76
ttft
390ms
textvisionaudio
Vertex AI
hyperscaler
live

Gemini + Claude + Llama via GCP with data residency.

uptime
99.94%
tps
115
ttft
200ms
textvisionaudiovideo
Perplexity
specialty
live

Sonar models with built-in web grounding.

uptime
99.7%
tps
120
ttft
260ms
text
Cohere
frontier
live

Command R+, best-in-class embeddings and rerankers.

uptime
99.85%
tps
105
ttft
290ms
text
Replicate
open source-host
live

Long-tail OSS models and image/video pipelines.

uptime
99.6%
tps
60
ttft
900ms
textimagevideoaudio
RunPod
open source-host
beta

GPU spot capacity with serverless endpoints.

uptime
99.5%
tps
130
ttft
220ms
textimage
llmcloud OSS
open source-host
live

Our own hosted open-weight fleet — tuned for throughput.

uptime
99.9%
tps
260
ttft
100ms
textvision
For inference providers

List your endpoints on llmcloud.ai

Reach thousands of developers, get commission-based routing when your endpoints win on price, latency, or quality. Standard OpenAI-compatible API required.

Start onboarding →