Model discovery workbench

Move from a crowded market to a defensible shortlist. Rank models by capability, task economics, speed, context, and real provider availability.
Models
194
Providers
89
Data snapshot
Sep 14, 2026, 16:24 UTC
Method
Index v4.3
Latest tracked
Sep 11, 2026
Rank by

Model rankings

174 results · sorted by intelligence

Underlined names open model pages. Use the chevron for endpoint details.
1Claude Fable 5.1Anthropicintelligence53.4Task $2.37Response 16s1.0M context1 provider
2GPT-6 AstraOpenAIintelligence52.8Task $3.26Response 5.5 min1.0M context1 provider
3GPT-6 Astra (xhigh)OpenAIintelligence52.5Task $2.31Response 2.4 min1.0M context1 provider
4GPT-6 Astra (high)OpenAIintelligence51Task $1.72Response 44s1.0M context1 provider
5Claude Opus 5Anthropicintelligence50.7Task $1.10Response 13s1.0M context3 providers
6Claude Fable 5Anthropicintelligence49.7Task $8.75Response 89s1.0M context3 providers
7GPT-6 Astra (medium)OpenAIintelligence49.7Task $1.54Response 14s1.0M context1 provider
8Muse Spark 1.3OpenMetaintelligence48.2Task $1.60Response 34s1.0M context1 provider
9GPT-5.6 SolOpenAIintelligence47.1Task $1.99Response 9.3s1.0M context3 providers
10GPT-6 Astra (low)OpenAIintelligence46Task $0.818Response 12s1.0M context1 provider
11Muse Spark 1.3 (xhigh)OpenMetaintelligence45.2Task $1.37Response 32s1.0M context1 provider
12GLM-5.3OpenZ AIintelligence44.9Task $2.01Response 41s1.0M context15 providers
13Grok 4.6 (high)SpaceXAIintelligence44.4Task $1.86Response 38s500K context1 provider
14Grok 4.6 (xhigh)SpaceXAIintelligence44.3Task $2.32Response 47s500K context1 provider
16Kimi K3OpenKimiintelligence43.8Task $2.00Response 69s1.0M context11 providers
17Grok 4.6 (medium)SpaceXAIintelligence43Task $1.50Response 33s500K context1 provider
19GPT-5.6 TerraOpenAIintelligence42.3Task $1.40Response 6.8s1.0M context2 providers
20GLM-5.3-FlashOpenZ AIintelligence41.9Task $0.253Response 27s1.0M context18 providers
21Gemini 3.8 Flash (high)Googleintelligence41.2Task $1.24Response 14s1.0M context1 provider
22Qwen3.8 MaxOpenAlibabaintelligence40.3Task $2.67Response 69s1.0M context1 provider
23Qwen3.8 2.4T A95BOpenAlibabaintelligence40Task $2.16Response 68s984K context6 providers
24Qwen3.8-Flash-NextOpenAlibabaintelligence39.9Task $0.372Response 51s1.0M context2 providers
25Muse Spark 1.2 (xhigh)OpenMetaintelligence39.8Task $0.975Response 28s1.0M context1 provider
26Gemini 3.7 Flash (medium)Googleintelligence39.6Task N/AResponse 6.2s1.0M context1 provider
28DeepSeek V4.1 FlashOpenDeepSeekintelligence39.5Task $0.265Response 13s1.0M context2 providers
29Gemini 3.7 Flash (high)Googleintelligence39.4Task $0.925Response 12s1.0M context1 provider
30Grok 4.5 (high)SpaceXAIintelligence39.1Task $1.04Response 20s500K context1 provider

Reading the field

How to use this LLM ranking page

Start with capability, then force the economics

Frontier models often cluster tightly on raw intelligence. Cost per task, response time, provider coverage, and context length usually create the real shortlist.

Move from discovery to a defensible final pick

Use Explore to find the shape of the market, then move into Compare or use the Agentic Fit Finder when task-level reliability and cost matter more than chat quality alone.

Field notes

Questions builders ask

What is the best LLM in 2026?

Claude Fable 5.1 leads the overall quality ranking right now. The best model for you depends on your use case — coding, cost, speed, and context length all shift the answer.

How do I compare LLMs?

Sort by Quality Index for overall strength, then filter by price, speed, or context window to match your constraints. Move to the Compare page to put 2–4 finalists head to head.

Which AI model has the best quality-to-price ratio?

Open-weight models like DeepSeek, Qwen, and Llama often lead on quality-to-price. For agentic workflows, cost per task is usually a better filter than token price alone.

How often is this leaderboard updated?

Data is pulled from Artificial Analysis and refreshed automatically. New models appear as soon as they have benchmark scores and provider endpoints.