Model discovery workbench

Move from a crowded market to a defensible shortlist. Rank models by capability, task economics, speed, context, and real provider availability.
Models
162
Providers
99
Data snapshot
Sep 30, 2026, 16:27 UTC
Method
Index v4.3
Latest tracked
Oct 1, 2026
Rank by

Model rankings

146 results · sorted by intelligence

Underlined names open model pages. Use the chevron for endpoint details.
1Claude Opus 5.5Anthropicintelligence57.6Task $0.551Response 14s1.0M context3 providers
2Claude Sonnet 5.5Anthropicintelligence56Task $0.417Response 6.3s1.0M context3 providers
3Claude Fable 5.1Anthropicintelligence53.4Task $2.37Response 13s1.0M context1 provider
4GPT-6 AstraOpenAIintelligence52.7Task $3.26Response 4.9 min1.0M context3 providers
5GPT-6 Astra (Xhigh)OpenAIintelligence52.4Task $2.31Response 2.5 min1.0M context1 provider
6GPT-6.1 SolOpenAIintelligence51.8Task $0.724Response 4.7 min1.0M context1 provider
7GPT-6.1 Sol (Xhigh)OpenAIintelligence51Task $0.393Response 2.8 min1.0M context1 provider
8GPT-6 Astra (High)OpenAIintelligence50.9Task $1.73Response 89s1.0M context1 provider
9GPT-6.1 Sol (High)OpenAIintelligence50.2Task $0.319Response 60s1.0M context1 provider
10GPT-6 Astra (Medium)OpenAIintelligence49.6Task $1.54Response 15s1.0M context1 provider
11Muse Spark 1.3OpenMetaintelligence48.1Task $1.60Response 65s1.0M context1 provider
12GPT-6.1 Sol (Medium)OpenAIintelligence47.8Task $0.214Response 16s1.0M context1 provider
13Grok 4.7 (Xhigh)SpaceXAIintelligence46.4Task $3.74Response 49s500K context1 provider
14MiMo-V2.6-ProOpenXiaomiintelligence46.3Task $0.133Response 62s1.0M context4 providers
15Grok 4.7 (High)SpaceXAIintelligence46.3Task $2.73Response 44s500K context1 provider
16GPT-6 Astra (Low)OpenAIintelligence45.8Task $0.818Response 12s1.0M context2 providers
17Qwen3.8 MaxOpenAlibabaintelligence45.4Task $5.41Response 70s984K context1 provider
18Muse Spark 1.3 (Xhigh)OpenMetaintelligence45.1Task $1.37Response 45s1.0M context1 provider
19GLM-5.3OpenZ AIintelligence44.8Task $2.01Response 38s1.0M context23 providers
20Step 5 PreviewStepFunintelligence43.7Task $0.718Response 31s1.0M context1 provider
21Kimi K3OpenKimiintelligence43.6Task $2.00Response 61s1.0M context15 providers
22Grok 4.7 (Low)SpaceXAIintelligence42.2Task $1.25Response 12s500K context1 provider
23GPT-5.6 TerraOpenAIintelligence42.1Task $0.140Response 5.8s1.0M context2 providers
24GPT-6.1 Sol (Low)OpenAIintelligence42.1Task $0.131Response 13s1.0M context1 provider
25GLM 5.3 FlashOpenZ AIintelligence41.8Task $0.253Response 51s1.0M context21 providers
26Ling 3.1 FlashOpenInclusionAIintelligence41.1Task $0.986Response 14s1.0M context1 provider
27Gemini 3.8 Flash (High)Googleintelligence40.9Task $1.24Response 15s1.0M context1 provider
28Qwen3.8 2.4T A95BOpenAlibabaintelligence39.9Task $2.16Response 69s1.0M context6 providers
29Qwen3.8-Flash-NextOpenAlibabaintelligence39.8Task $0.372Response 48s1.0M context1 provider
30DeepSeek V4.1 FlashOpenDeepSeekintelligence39.5Task $0.147Response 3.3s1.0M context21 providers

Reading the field

How to use this LLM ranking page

Start with capability, then force the economics

Frontier models often cluster tightly on raw intelligence. Cost per task, response time, provider coverage, and context length usually create the real shortlist.

Move from discovery to a defensible final pick

Use Explore to find the shape of the market, then move into Compare or use the Agentic Fit Finder when task-level reliability and cost matter more than chat quality alone.

Field notes

Questions builders ask

What is the best LLM in 2026?

Claude Opus 5.5 leads the overall quality ranking right now. The best model for you depends on your use case — coding, cost, speed, and context length all shift the answer.

How do I compare LLMs?

Sort by Quality Index for overall strength, then filter by price, speed, or context window to match your constraints. Move to the Compare page to put 2–4 finalists head to head.

Which AI model has the best quality-to-price ratio?

Open-weight models like DeepSeek, Qwen, and Llama often lead on quality-to-price. For agentic workflows, cost per task is usually a better filter than token price alone.

How often is this leaderboard updated?

Data is pulled from Artificial Analysis and refreshed automatically. New models appear as soon as they have benchmark scores and provider endpoints.