← All providers
specialty

Cerebras

Wafer-scale inference; fastest tokens/sec for Llama-70B class.

live
Uptime (30d)
99.6%
Median tps
950
Median TTFT
35 ms
Price index
0.9×
vs. market median
Overview
HQ
Sunnyvale, US
Founded
2016
Models
8
Modalities
text
Regions
us-west
Strengths
ultra-low-latency
Route via llmcloud
curl https://api.llmcloud.ai/v1/chat/completions \
  -H "Authorization: Bearer $LLMCLOUD_KEY" \
  -H "X-Provider: cerebras" \
  -d '{
    "model": "auto:quality",
    "messages": [{"role":"user","content":"hi"}]
  }'