Skip to content

AI data

Updated · By , AI-assisted.

The AI model leaderboard, job by job

Each job's leaderboard from our test runs of September 27, 28, 29 and October 2, 7, 8, 9, 2026: all 19 models ranked on its five prompts by passes, then hard passes, then message size and cost. The top of the table runs from 3 models sharing first on writing to 19 sharing it on RAG and answering from documents.

Every job added up, in one order: the best AI model right now.

Coding: the leaderboard

Our picks and every reply: The best AI for coding.

Coding: every model ranked
ModelPlacePassedHard onesPer replyTime
GLM 5.3 Flash=15 of 52 of 2$0.000258.0 s
GPT-6 Luna=15 of 52 of 2$0.000294.9 s
Claude Haiku 5.5=15 of 52 of 2$0.000454.0 s
DeepSeek V4.1 Flash=15 of 52 of 2$0.00183.9 s
GLM 5.3=15 of 52 of 2$0.00153.5 s
Gemini 3.8 Flash=15 of 52 of 2$0.00204.4 s
DeepSeek V4 Pro=15 of 52 of 2$0.024079.6 s
Grok 4.7=15 of 52 of 2$0.024646.9 s
GPT-6.1 Sol=15 of 52 of 2$0.00234.9 s
GPT-6 Sol=15 of 52 of 2$0.00525.7 s
Claude Sonnet 5.5=15 of 52 of 2$0.00633.0 s
Kimi K3=15 of 52 of 2$0.00635.2 s
Claude Sonnet 5=15 of 52 of 2$0.01028.0 s
Gemini 3.1 Pro=15 of 52 of 2$0.019513.2 s
Claude Opus 5.5=15 of 52 of 2$0.01718.3 s
GPT-6 Astra=15 of 52 of 2$0.02236.8 s
Claude Fable 5.1=15 of 52 of 2$0.04259.1 s
Mistral Large 4184 of 51 of 2$0.007341.0 s
Claude Haiku 4.5193 of 50 of 2$0.00273.4 s

Writing: the leaderboard

Our picks and every reply: The best AI for writing.

Writing: every model ranked
ModelPlacePassedHard onesPer replyTime
GPT-6 Luna=15 of 52 of 2$0.0000992.1 s
DeepSeek V4 Pro=15 of 52 of 2$0.00113.8 s
GPT-6 Astra=15 of 52 of 2$0.01114.9 s
DeepSeek V4.1 Flash=44 of 52 of 2$0.000451.6 s
GPT-6.1 Sol=44 of 52 of 2$0.00113.2 s
GPT-6 Sol=44 of 52 of 2$0.00233.1 s
Claude Sonnet 5=44 of 52 of 2$0.00344.2 s
GLM 5.3=84 of 51 of 2$0.000571.7 s
Claude Haiku 4.5=84 of 51 of 2$0.00112.4 s
Mistral Large 4=84 of 51 of 2$0.002419.7 s
Claude Sonnet 5.5=84 of 51 of 2$0.00342.8 s
Kimi K3=84 of 51 of 2$0.00382.9 s
Gemini 3.1 Pro=84 of 51 of 2$0.00928.6 s
Claude Opus 5.5=84 of 51 of 2$0.01859.7 s
Claude Haiku 5.5=153 of 51 of 2$0.000162.2 s
Gemini 3.8 Flash=153 of 51 of 2$0.00134.7 s
Grok 4.7=153 of 51 of 2$0.00589.4 s
Claude Fable 5.1183 of 50 of 2$0.01726.7 s
GLM 5.3 Flash192 of 50 of 2$0.0003213.9 s

Math: the leaderboard

Our picks and every reply: The best AI for math.

Math: every model ranked
ModelPlacePassedHard onesPer replyTime
Claude Haiku 5.5=15 of 52 of 2$0.000151.7 s
GLM 5.3 Flash=15 of 52 of 2$0.000155.1 s
DeepSeek V4.1 Flash=15 of 52 of 2$0.000251.1 s
GLM 5.3=15 of 52 of 2$0.000351.1 s
DeepSeek V4 Pro=15 of 52 of 2$0.000882.9 s
Gemini 3.8 Flash=15 of 52 of 2$0.00143.8 s
Claude Haiku 4.5=15 of 52 of 2$0.00152.4 s
Mistral Large 4=15 of 52 of 2$0.001810.2 s
Grok 4.7=15 of 52 of 2$0.007211.6 s
GPT-6.1 Sol=15 of 52 of 2$0.000862.0 s
GPT-6 Sol=15 of 52 of 2$0.00182.2 s
Claude Sonnet 5.5=15 of 52 of 2$0.00251.7 s
Claude Sonnet 5=15 of 52 of 2$0.00334.1 s
Kimi K3=15 of 52 of 2$0.00374.9 s
Gemini 3.1 Pro=15 of 52 of 2$0.01007.5 s
Claude Opus 5.5=15 of 52 of 2$0.00604.1 s
GPT-6 Astra=15 of 52 of 2$0.00852.7 s
Claude Fable 5.1=15 of 52 of 2$0.01164.6 s
GPT-6 Luna194 of 52 of 2$0.0000982.4 s

Summarization: the leaderboard

Our picks and every reply: The best AI for summarization.

Summarization: every model ranked
ModelPlacePassedHard onesPer replyTime
DeepSeek V4.1 Flash=15 of 52 of 2$0.000200.9 s
Gemini 3.8 Flash=15 of 52 of 2$0.000753.7 s
DeepSeek V4 Pro=15 of 52 of 2$0.000912.6 s
Claude Haiku 4.5=15 of 52 of 2$0.00101.9 s
Grok 4.7=15 of 52 of 2$0.00283.5 s
Mistral Large 4=15 of 52 of 2$0.004327.3 s
GPT-6.1 Sol=15 of 52 of 2$0.00102.0 s
Gemini 3.1 Pro=15 of 52 of 2$0.00888.3 s
Claude Opus 5.5=15 of 52 of 2$0.00954.7 s
GPT-6 Astra=15 of 52 of 2$0.01093.0 s
GPT-6 Luna=114 of 52 of 2$0.0000941.4 s
GLM 5.3=114 of 52 of 2$0.000541.4 s
GPT-6 Sol=114 of 52 of 2$0.00222.4 s
Claude Sonnet 5.5=114 of 52 of 2$0.00342.0 s
GLM 5.3 Flash=153 of 52 of 2$0.000114.4 s
Claude Haiku 5.5=153 of 52 of 2$0.000323.0 s
Claude Sonnet 5=153 of 52 of 2$0.00282.7 s
Kimi K3=153 of 52 of 2$0.00346.3 s
Claude Fable 5.1=153 of 52 of 2$0.01614.6 s

Data analysis: the leaderboard

Data analysis: every model ranked
ModelPlacePassedHard onesPer replyTime
GPT-6 Luna=15 of 52 of 2$0.000183.4 s
Claude Haiku 5.5=15 of 52 of 2$0.000363.2 s
DeepSeek V4.1 Flash=15 of 52 of 2$0.000851.8 s
GLM 5.3=15 of 52 of 2$0.00192.4 s
DeepSeek V4 Pro=15 of 52 of 2$0.00294.1 s
Mistral Large 4=15 of 52 of 2$0.003716.4 s
Grok 4.7=15 of 52 of 2$0.011116.1 s
GPT-6.1 Sol=15 of 52 of 2$0.00163.5 s
GPT-6 Sol=15 of 52 of 2$0.00343.5 s
Claude Sonnet 5.5=15 of 52 of 2$0.00472.4 s
Kimi K3=15 of 52 of 2$0.00687.0 s
Gemini 3.1 Pro=15 of 52 of 2$0.01559.9 s
Claude Opus 5.5=15 of 52 of 2$0.01315.9 s
GPT-6 Astra=15 of 52 of 2$0.01544.0 s
Claude Fable 5.1=15 of 52 of 2$0.02836.7 s
GLM 5.3 Flash=164 of 51 of 2$0.0003811.2 s
Gemini 3.8 Flash=164 of 51 of 2$0.00285.4 s
Claude Sonnet 5=164 of 51 of 2$0.00696.9 s
Claude Haiku 4.5193 of 51 of 2$0.00253.2 s

Customer support: the leaderboard

Our picks and every reply: The best AI for customer support.

Customer support: every model ranked
ModelPlacePassedHard onesPer replyTime
GLM 5.3=15 of 52 of 2$0.000472.6 s
Claude Sonnet 5=15 of 52 of 2$0.00363.7 s
Gemini 3.1 Pro=15 of 52 of 2$0.01068.7 s
Claude Opus 5.5=15 of 52 of 2$0.01086.5 s
GPT-6 Luna=54 of 52 of 2$0.0000861.4 s
Claude Haiku 5.5=54 of 52 of 2$0.000232.4 s
DeepSeek V4 Pro=54 of 52 of 2$0.00154.8 s
Gemini 3.8 Flash=54 of 52 of 2$0.00164.6 s
Grok 4.7=54 of 52 of 2$0.00619.8 s
Claude Sonnet 5.5=54 of 52 of 2$0.00463.1 s
DeepSeek V4.1 Flash=114 of 51 of 2$0.000461.4 s
Mistral Large 4=114 of 51 of 2$0.00157.2 s
Kimi K3=114 of 51 of 2$0.00465.3 s
Claude Fable 5.1=114 of 51 of 2$0.02215.9 s
GPT-6 Sol=153 of 52 of 2$0.00293.6 s
GPT-6 Astra=153 of 52 of 2$0.01163.6 s
Claude Haiku 4.5173 of 51 of 2$0.00152.6 s
GLM 5.3 Flash=182 of 51 of 2$0.000195.4 s
GPT-6.1 Sol=182 of 51 of 2$0.00123.0 s

Translation: the leaderboard

Our picks and every reply: The best AI for translation.

Translation: every model ranked
ModelPlacePassedHard onesPer replyTime
GPT-6 Luna=15 of 52 of 2$0.0000931.7 s
GLM 5.3 Flash=15 of 52 of 2$0.0000993.7 s
Claude Haiku 5.5=15 of 52 of 2$0.000181.7 s
DeepSeek V4.1 Flash=15 of 52 of 2$0.000581.4 s
GLM 5.3=15 of 52 of 2$0.000701.6 s
Gemini 3.8 Flash=15 of 52 of 2$0.000753.1 s
Claude Haiku 4.5=15 of 52 of 2$0.00152.3 s
DeepSeek V4 Pro=15 of 52 of 2$0.00206.7 s
Mistral Large 4=15 of 52 of 2$0.003116.8 s
Grok 4.7=15 of 52 of 2$0.008213.8 s
GPT-6.1 Sol=15 of 52 of 2$0.00133.2 s
Claude Sonnet 5=15 of 52 of 2$0.00303.2 s
Kimi K3=15 of 52 of 2$0.00365.3 s
Claude Sonnet 5.5=15 of 52 of 2$0.00422.6 s
Gemini 3.1 Pro=15 of 52 of 2$0.014010.4 s
Claude Opus 5.5=15 of 52 of 2$0.01085.9 s
GPT-6 Astra=15 of 52 of 2$0.01264.2 s
Claude Fable 5.1=15 of 52 of 2$0.01755.6 s
GPT-6 Sol194 of 51 of 2$0.00283.5 s

SQL: the leaderboard

Our picks and every reply: The best AI for SQL.

SQL: every model ranked
ModelPlacePassedHard onesPer replyTime
GPT-6 Luna=15 of 52 of 2$0.0000891.5 s
GLM 5.3 Flash=15 of 52 of 2$0.000131.7 s
DeepSeek V4.1 Flash=15 of 52 of 2$0.000200.7 s
Claude Haiku 5.5=15 of 52 of 2$0.000221.6 s
GLM 5.3=15 of 52 of 2$0.000321.5 s
Gemini 3.8 Flash=15 of 52 of 2$0.000743.6 s
Claude Haiku 4.5=15 of 52 of 2$0.000991.4 s
DeepSeek V4 Pro=15 of 52 of 2$0.00207.4 s
Mistral Large 4=15 of 52 of 2$0.00229.3 s
Grok 4.7=15 of 52 of 2$0.00486.1 s
GPT-6.1 Sol=15 of 52 of 2$0.000992.0 s
GPT-6 Sol=15 of 52 of 2$0.00211.9 s
Kimi K3=15 of 52 of 2$0.00241.9 s
Claude Sonnet 5=15 of 52 of 2$0.00282.5 s
Claude Sonnet 5.5=15 of 52 of 2$0.00381.9 s
Gemini 3.1 Pro=15 of 52 of 2$0.00777.3 s
Claude Opus 5.5=15 of 52 of 2$0.00924.4 s
GPT-6 Astra=15 of 52 of 2$0.00982.8 s
Claude Fable 5.1=15 of 52 of 2$0.01854.5 s

RAG and answering from documents: the leaderboard

Our picks and every reply: The best AI for RAG and answering from documents.

RAG and answering from documents: every model ranked
ModelPlacePassedHard onesPer replyTime
GPT-6 Luna=15 of 52 of 2$0.0000771.3 s
Claude Haiku 5.5=15 of 52 of 2$0.000141.2 s
GLM 5.3 Flash=15 of 52 of 2$0.000152.3 s
DeepSeek V4.1 Flash=15 of 52 of 2$0.000170.5 s
GLM 5.3=15 of 52 of 2$0.000500.8 s
DeepSeek V4 Pro=15 of 52 of 2$0.000603.1 s
Gemini 3.8 Flash=15 of 52 of 2$0.000663.2 s
Claude Haiku 4.5=15 of 52 of 2$0.00101.3 s
Mistral Large 4=15 of 52 of 2$0.001411.1 s
Grok 4.7=15 of 52 of 2$0.00292.4 s
GPT-6.1 Sol=15 of 52 of 2$0.000791.5 s
Kimi K3=15 of 52 of 2$0.00153.2 s
GPT-6 Sol=15 of 52 of 2$0.00161.3 s
Claude Sonnet 5=15 of 52 of 2$0.00221.9 s
Claude Sonnet 5.5=15 of 52 of 2$0.00281.3 s
Gemini 3.1 Pro=15 of 52 of 2$0.00586.2 s
Claude Opus 5.5=15 of 52 of 2$0.00733.8 s
GPT-6 Astra=15 of 52 of 2$0.00791.8 s
Claude Fable 5.1=15 of 52 of 2$0.01454.9 s

Agents and tool use: the leaderboard

Our picks and every reply: The best AI for agents and tool use.

Agents and tool use: every model ranked
ModelPlacePassedHard onesPer replyTime
GPT-6 Luna=15 of 52 of 2$0.0000811.7 s
Claude Haiku 5.5=15 of 52 of 2$0.000141.6 s
DeepSeek V4.1 Flash=15 of 52 of 2$0.000200.5 s
GLM 5.3=15 of 52 of 2$0.000441.0 s
DeepSeek V4 Pro=15 of 52 of 2$0.000662.0 s
Gemini 3.8 Flash=15 of 52 of 2$0.000874.6 s
Claude Haiku 4.5=15 of 52 of 2$0.000951.1 s
Mistral Large 4=15 of 52 of 2$0.00135.6 s
Grok 4.7=15 of 52 of 2$0.00396.1 s
GPT-6.1 Sol=15 of 52 of 2$0.000731.6 s
GPT-6 Sol=15 of 52 of 2$0.00161.9 s
Claude Sonnet 5=15 of 52 of 2$0.00243.0 s
Claude Sonnet 5.5=15 of 52 of 2$0.00261.8 s
Kimi K3=15 of 52 of 2$0.00272.4 s
Gemini 3.1 Pro=15 of 52 of 2$0.00575.7 s
Claude Opus 5.5=15 of 52 of 2$0.00503.8 s
GPT-6 Astra=15 of 52 of 2$0.00682.0 s
Claude Fable 5.1=15 of 52 of 2$0.01193.8 s
GLM 5.3 Flash194 of 52 of 2$0.000133.7 s

More AI data

Also from primary sources: OpenRouter's usage accounting docs (the cost OpenRouter reports for every request, which these figures add up). Anthropic's Claude Opus 5.5 page (the model that grades the rubric prompts). OpenAI's GPT-6 Astra docs (the model that grades Claude Opus 5.5's own replies). Read .

Bar chart: Prompts passed in our test runs, all 10 jobs. DeepSeek V4 Pro: 49 of 50; Gemini 3.1 Pro (preview): 49 of 50; Claude Opus 5.5: 49 of 50; GPT-6 Astra: 48 of 50; DeepSeek V4.1 Flash: 48 of 50; GLM 5.3: 48 of 50; GPT-6 Luna: 47 of 50; Grok 4.7: 47 of 50; Claude Sonnet 5.5: 47 of 50; Mistral Large 4: 47 of 50; GPT-6.1 Sol: 46 of 50; Claude Sonnet 5: 46 of 50; Gemini 3.8 Flash: 46 of 50; Kimi K3: 46 of 50; Claude Haiku 5.5: 45 of 50; GPT-6 Sol: 45 of 50; Claude Fable 5.1: 45 of 50; Claude Haiku 4.5: 43 of 50; GLM 5.3 Flash: 40 of 50.
Our test runs of September 27, 28, 29 and October 2, 7, 8, 9, 2026: the same prompts for every model, each reply checked the same way.

The leaderboard: how it's ranked

Where's the overall ranking?

The overall ranking, every job added up, is on “The best AI model right now”. This page is each job on its own, where the order changes: a model that leads overall can sit mid-table on one job.

How is each job ranked?

By how many of the job's prompts each model passed, then how many of the hard ones, then by the smaller message (the everyday models first), then the lower cost per reply. A place shared on passes and hard passes is marked “=”.

The leaders, on your own work

A ranking says how models did on five prompts per job. Try the top two on your work: switch models mid-chat, and the next one sees the whole conversation.