frostflash

LLM Leaderboard

Ranked by LMArena Elo · source LMArena

Human preference Elo from chatbot arena head-to-head votes.

#1 by LMArena Elo
Claude Opus 5 (Adaptive Reasoning, High Effort)
1505
Anthropic · in $5.00 / out $25.0 per 1M · 55 tok/s
#ModelLMArena
1Claude Opus 5 (Adaptive Reasoning, High Effort)1505
2Claude Opus 4.6 (Adaptive Reasoning, Max Effort)1498
3Claude Opus 4.6 (Non-reasoning, High Effort)1498
4Gemini 3.8 Flash (high)1495
5Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 5 Fallback)1493
6Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)1493
7Claude Fable 5.1 (Adaptive Reasoning, Xhigh Effort, Default Fallback)1493
8Claude Fable 5.1 (Adaptive Reasoning, High Effort, Default Fallback)1493
9Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)1493
10Claude Fable 5.1 (Adaptive Reasoning, Medium Effort, Default Fallback)1493
11Claude Fable 5.1 (Adaptive Reasoning, Low Effort, Default Fallback)1493
12Gemini 3.7 Flash (high)1490
13Muse Spark 1.3 (max)1490
14Muse Spark 1.2 (xhigh)1489
15Claude Opus 4.7 (Adaptive Reasoning, Max Effort)1483
16Claude Opus 4.7 (Non-reasoning, High Effort)1483
17Gemini 3.5 Flash (high)1482
18Qwen3.8 Max (0902)1481
19Qwen3.8 Max1481
20Muse Spark 1.1 (xhigh)1480
21Gemini 3.1 Pro Preview1480
22Gemini 3 Pro Preview (high)1479
23Gemini 3 Pro Preview (low)1479
24Gemini 3.6 Flash (high)1476
25Gemini 3.5 Flash (medium)1476
26GLM-5.3 (max)1475
27Qwen3.7 Max1474
28Muse Spark 1.3 (max)1473
29Muse Spark 1.3 (xhigh)1473
30Muse Spark1473
31Kimi K3 (max)1472
32GLM 5.3 Flash1472
33GPT-5.5 (high)1471
34GLM-5.2 (max)1467
35Gemini 3 Flash Preview (Reasoning)1467
36Gemini 3 Flash Preview (Non-reasoning)1467
37GPT-5.5 (xhigh)1466
38GPT-5.5 (medium)1466
39GPT-5.5 (low)1466
40GPT-5.5 Instant (June 2026)1466
41GPT-5.5 (Non-reasoning)1466
42GPT-5.5 Instant (May 2026)1466
43GPT-5.5 Pro (xhigh)1466
44MiMo-V2.5-Pro1465
45MiMo-V2.5-Pro (Non-reasoning)1465
46GLM-5.1 (Reasoning)1462
47GLM-5.1 (Non-reasoning)1462
48Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort)1458
49Claude Sonnet 4.6 (Non-reasoning, High Effort)1458
50Claude Sonnet 4.6 (Non-reasoning, Low Effort)1458

Quality, pricing, and speed benchmarks via Artificial Analysis. Human preference Elo via LMArena. Refreshed daily at 06:00 UTC · last sync .

About the metrics

Intelligence Index
AA
Artificial Analysis composite of reasoning, knowledge, coding, math.
LMArena Elo
LMArena
Human preference Elo from chatbot arena head-to-head votes.
Coding Index
AA
AA composite — LiveCodeBench, SciCode, etc.
Math Index
AA
AA composite — MATH-500, AIME, etc.
MMLU-Pro
AA
Multi-domain knowledge & reasoning. Harder than MMLU.
GPQA Diamond
AA
Graduate-level science Q&A. Strong reasoning signal.
LiveCodeBench
AA
Competitive programming, contamination-resistant.
MATH-500
AA
Subset of the MATH benchmark.
AIME
AA
American Invitational Mathematics Examination — olympiad math.
Humanity's Last Exam
AA
Frontier reasoning benchmark; most models still score low.
SciCode
AA
Scientific coding tasks.