frostflash

LLM Leaderboard

Ranked by Intelligence Index · source AA

Artificial Analysis composite of reasoning, knowledge, coding, math.

#1 by Intelligence Index
Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)
53.4
Anthropic · in $10.0 / out $50.0 per 1M · 70 tok/s
#ModelIntelligence
1Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)53.4
2Claude Fable 5.1 (Adaptive Reasoning, Xhigh Effort, Default Fallback)53.2
3Muse Spark 1.3 (max)53.0
4GPT-6 Astra (max)52.8
5GPT-6 Astra (xhigh)52.5
6Claude Fable 5.1 (Adaptive Reasoning, High Effort, Default Fallback)51.2
7GPT-6 Astra (high)51.0
8Claude Opus 5 (Adaptive Reasoning, Max Effort)50.7
9Claude Opus 5 (Adaptive Reasoning, Xhigh Effort)49.7
10Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)49.7
11GPT-6 Astra (medium)49.7
12Claude Fable 5.1 (Adaptive Reasoning, Medium Effort, Default Fallback)49.1
13Claude Opus 5 (Adaptive Reasoning, High Effort)48.2
14Muse Spark 1.3 (max)48.2
15GPT-5.6 Sol (max)47.1
16Claude Fable 5.1 (Adaptive Reasoning, Low Effort, Default Fallback)47.0
17GPT-6 Astra (low)46.0
18Qwen3.8 Max (0902)45.4
19GPT-6 Astra (Non-reasoning)45.2
20Muse Spark 1.3 (xhigh)45.2
21Claude Opus 5 (Adaptive Reasoning, Medium Effort)45.1
22GLM-5.3 (max)44.9
23Grok 4.6 (high)44.4
24Grok 4.6 (xhigh)44.3
25GPT-5.6 Sol (xhigh)44.1
26Kimi K3 (max)43.8
27Grok 4.6 (medium)43.0
28GPT-5.6 Sol (high)42.5
29GPT-5.6 Terra (max)42.3
30Claude Opus 4.8 (Adaptive Reasoning, Max Effort)42.0
31GLM 5.3 Flash41.9
32Gemini 3.8 Flash (high)41.2
33Claude Opus 4.7 (Adaptive Reasoning, Max Effort)40.7
34Qwen3.8 Max40.3
35Gemini 3.8 Flash (medium)40.0
36Qwen3.8 2.4T A95B40.0
37Qwen3.8-Flash-Next39.9
38Muse Spark 1.2 (xhigh)39.8
39Claude Opus 5 (Adaptive Reasoning, Low Effort)39.8
40Gemini 3.7 Flash (medium)39.6
41DeepSeek V4.1 Flash (Reasoning, Max Effort)39.5
42GPT-5.6 Sol (medium)39.5
43Gemini 3.7 Flash (high)39.4
44Grok 4.5 (high)39.1
45GPT-5.4 (xhigh)39.0
46GPT-5.5 (xhigh)38.6
47Claude Sonnet 5 (Adaptive Reasoning, Max Effort)38.4
48GPT-5.6 Terra (xhigh)38.2
49GPT-5.6 Luna (max)37.5
50GPT-5.5 (high)37.3

Quality, pricing, and speed benchmarks via Artificial Analysis. Human preference Elo via LMArena. Refreshed daily at 06:00 UTC · last sync .

About the metrics

Intelligence Index
AA
Artificial Analysis composite of reasoning, knowledge, coding, math.
LMArena Elo
LMArena
Human preference Elo from chatbot arena head-to-head votes.
Coding Index
AA
AA composite — LiveCodeBench, SciCode, etc.
Math Index
AA
AA composite — MATH-500, AIME, etc.
MMLU-Pro
AA
Multi-domain knowledge & reasoning. Harder than MMLU.
GPQA Diamond
AA
Graduate-level science Q&A. Strong reasoning signal.
LiveCodeBench
AA
Competitive programming, contamination-resistant.
MATH-500
AA
Subset of the MATH benchmark.
AIME
AA
American Invitational Mathematics Examination — olympiad math.
Humanity's Last Exam
AA
Frontier reasoning benchmark; most models still score low.
SciCode
AA
Scientific coding tasks.