Scorecards
Every model, graded the same way.
Vendor benchmarks are marketing. These are gateway measurements: composite quality, throughput, time to first token, price efficiency and usable context — plus the workloads each model should actually be used for.
Anthropic
claude-opus-4.5
q94.282 tok/s320ms$15.00/1M200k
OpenAI
gpt-5.5
q93.874 tok/s410ms$12.50/1M400k
Anthropic
claude-opus-4.1
q93.178 tok/s340ms$15.00/1M200k
OpenAI
gpt-5
q92.478 tok/s420ms$10.00/1M400k
Google
gemini-3.1-pro
q92.1118 tok/s180ms$7.00/1M2000k
OpenAI
gpt-5-codex
q91.296 tok/s260ms$4.50/1M400k
Anthropic
claude-sonnet-4.5
q90.8118 tok/s220ms$3.00/1M200k
xAI
grok-5
q90.695 tok/s260ms$6.00/1M256k
Google
gemini-2.5-pro
q90.4108 tok/s210ms$5.00/1M2000k
OpenAI
o3
q90.162 tok/s520ms$10.00/1M200k
DeepSeek
deepseek-v4
q89.9140 tok/s210ms$0.55/1M128k
Anthropic
claude-sonnet-4
q89.4122 tok/s210ms$3.00/1M200k
Alibaba
qwen3-coder-480b
q89.4130 tok/s220ms$1.20/1M256k
xAI
grok-4
q89.190 tok/s280ms$5.00/1M256k
Alibaba
qwen3-235b-thinking
q88.982 tok/s340ms$0.90/1M128k
Alibaba
qwen3-max
q88.4128 tok/s240ms$0.90/1M1000k
Moonshot
kimi-k2-thinking
q88.482 tok/s360ms$3.00/1M256k
OpenAI
gpt-4.1
q88.292 tok/s300ms$8.00/1M1000k
DeepSeek
deepseek-r1
q88.290 tok/s320ms$0.55/1M128k
DeepSeek
deepseek-coder-v3
q88.2155 tok/s200ms$0.60/1M128k
Anthropic
claude-sonnet-3.7
q88.1128 tok/s200ms$3.00/1M200k
Meta
llama-4-405b
q87.6165 tok/s150ms$2.40/1M128k
OpenAI
o4-mini
q87.588 tok/s380ms$1.10/1M200k
DeepSeek
deepseek-v3.2-exp
q87.1150 tok/s200ms$0.28/1M128k
Alibaba
qwen3-vl-235b
q8776 tok/s380ms$2.00/1M128k
Meta
llama-4-maverick
q86.9178 tok/s140ms$1.80/1M128k
NVIDIA
nemotron-ultra-253b-v1
q86.7120 tok/s260ms$1.60/1M128k
Perplexity
sonar-deep-research
q86.560 tok/s640ms$8.00/1M128k
DeepSeek
deepseek-v3.1-terminus
q86.4148 tok/s205ms$0.27/1M128k
OpenAI
gpt-4o
q86.1105 tok/s260ms$5.00/1M128k
Alibaba
qwen3-235b-a22b
q86.1145 tok/s210ms$0.60/1M128k
Mistral
mistral-large-3
q86.1110 tok/s280ms$3.00/1M128k
Moonshot
kimi-k2-0905
q85.7140 tok/s220ms$2.50/1M256k
DeepSeek
deepseek-v3.1
q85.6145 tok/s210ms$0.27/1M128k
OpenAI
gpt-5.5-mini
q85.3210 tok/s120ms$0.40/1M400k
Meta
llama-3.1-405b-instruct
q85.2130 tok/s200ms$2.70/1M128k
Z.ai
glm-4.6
q85.1160 tok/s200ms$0.60/1M200k
Google
gemini-3.6-flash
q84.7240 tok/s90ms$0.30/1M1000k
MiniMax
minimax-m2
q84.6140 tok/s220ms$1.20/1M200k
OpenAI
o3-mini
q84.492 tok/s340ms$1.10/1M200k
Perplexity
sonar-reasoning-pro
q84.2110 tok/s280ms$8.00/1M128k
OpenAI
gpt-5-mini
q84.1215 tok/s125ms$0.35/1M400k
xAI
grok-3
q8492 tok/s300ms$3.00/1M128k
Baidu
ernie-4.5-vl-424b
q84100 tok/s300ms$1.20/1M128k
Anthropic
claude-haiku-4.5
q83.9195 tok/s130ms$0.80/1M200k
Mistral
mistral-large-2411
q83.4118 tok/s250ms$2.00/1M128k
Z.ai
glm-4.5
q83.4165 tok/s200ms$0.50/1M128k
ByteDance
doubao-seed-1.6
q83.2160 tok/s210ms$0.80/1M256k
DeepSeek
deepseek-coder-v2
q83.1170 tok/s180ms$0.40/1M128k
Google
gemini-2.5-flash
q82.9260 tok/s85ms$0.30/1M1000k
Cohere
command-a-03-2025
q82.9130 tok/s220ms$2.50/1M256k
OpenAI
gpt-4.1-mini
q82.6200 tok/s130ms$0.40/1M1000k
Alibaba
qwen3-coder-30b
q82.6220 tok/s110ms$0.30/1M256k
Amazon
nova-pro-v1
q82.6140 tok/s210ms$3.20/1M300k
DeepSeek
deepseek-r1-distill-70b
q82.5165 tok/s180ms$0.35/1M128k
Alibaba
qwen3-vl-72b
q82.488 tok/s340ms$1.20/1M128k
Baidu
ernie-4.5-300b
q82.4130 tok/s240ms$0.70/1M128k
Nous
hermes-4-405b
q82.4130 tok/s230ms$1.80/1M128k
Meta
llama-4-scout
q82.1240 tok/s100ms$0.60/1M10000k
Mistral
codestral-2508
q82.1200 tok/s120ms$0.40/1M256k