frostflash

LLM Leaderboard

Ranked by LMArena Elo · source LMArena

Human preference Elo from chatbot arena head-to-head votes.

#1 by LMArena Elo
GPT-5.5 (high)
1469
OpenAI · in $5.00 / out $30.0 per 1M · 79 tok/s
#ModelLMArena
1GPT-5.5 (high)1469
2GPT-5.5 (xhigh)1464
3GPT-5.5 (medium)1464
4GPT-5.5 (low)1464
5GPT-5.5 (Non-reasoning)1464
6GPT-5.5 Instant (May 2026)1464
7GPT-5.5 Instant (June 2026)1464
8GPT-5.5 Pro (xhigh)1464
9Gemini 2.5 Pro1462
10Gemini 2.5 Pro Preview (Mar' 25)1462
11Gemini 2.5 Pro Preview (May' 25)1462
12GPT-5.4 (xhigh)1462
13GPT-5.4 mini (xhigh)1462
14GPT-5.4 (low)1462
15GPT-5.4 nano (xhigh)1462
16GPT-5.4 nano (medium)1462
17GPT-5.4 mini (medium)1462
18GPT-5.4 (Non-reasoning)1462
19GPT-5.4 nano (Non-Reasoning)1462
20GPT-5.4 mini (Non-Reasoning)1462
21GPT-5.4 Pro (xhigh)1462
22Grok 4.5 (high)1460
23Grok 41460
24Gemini 3 Pro Preview (high)1457
25Gemini 3 Pro Preview (low)1457
26GPT-5.6 Sol (xhigh)1457
27Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)1457
28Inkling (xhigh)1454
29Claude Opus 4.8 (Adaptive Reasoning, Max Effort)1453
30Claude Opus 4.6 (Adaptive Reasoning, Max Effort)1449
31Claude Opus 4.6 (Non-reasoning, High Effort)1449
32GLM-4.6 (Reasoning)1448
33GLM-4.6 (Non-reasoning)1448
34GLM-4.6V (Reasoning)1448
35GLM-4.6V (Non-reasoning)1448
36Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort)1447
37Claude Sonnet 4.6 (Non-reasoning, High Effort)1447
38Claude Sonnet 4.6 (Non-reasoning, Low Effort)1447
39Gemini 3 Flash Preview (Reasoning)1446
40Gemini 3 Flash Preview (Non-reasoning)1446
41Grok 4.1 Fast (Reasoning)1446
42Grok 4.1 Fast (Non-reasoning)1446
43MiMo-V2.5-Pro1445
44MiMo-V2.5-Pro (Non-reasoning)1445
45Gemini 3.1 Pro Preview1445
46Muse Spark1445
47GPT-5.2 (xhigh)1443
48GPT-5.2 Codex (xhigh)1443
49GPT-5.2 (medium)1443
50GPT-5.2 (Non-reasoning)1443

Quality, pricing, and speed benchmarks via Artificial Analysis. Human preference Elo via LMArena. Refreshed daily at 06:00 UTC · last sync .

About the metrics

Intelligence Index
AA
Artificial Analysis composite of reasoning, knowledge, coding, math.
LMArena Elo
LMArena
Human preference Elo from chatbot arena head-to-head votes.
Coding Index
AA
AA composite — LiveCodeBench, SciCode, etc.
Math Index
AA
AA composite — MATH-500, AIME, etc.
MMLU-Pro
AA
Multi-domain knowledge & reasoning. Harder than MMLU.
GPQA Diamond
AA
Graduate-level science Q&A. Strong reasoning signal.
LiveCodeBench
AA
Competitive programming, contamination-resistant.
MATH-500
AA
Subset of the MATH benchmark.
AIME
AA
American Invitational Mathematics Examination — olympiad math.
Humanity's Last Exam
AA
Frontier reasoning benchmark; most models still score low.
SciCode
AA
Scientific coding tasks.