Top AI Models Ranked Across 7 Leaderboards
The best AI models (LLMs) ranked by a composite of 7 independent leaderboards: LMArena, Artificial Analysis, LLM Stats, Design Arena, Vellum, LiveBench and Vals.ai. Updated daily and cross-referenced with the most popular AI apps.
Last updated: 2026-08-11
- Claude Opus 5 by Anthropic — composite score 89.8/100 across 5 leaderboards (Artificial Analysis #1, Vellum #1, LiveBench #3, LMArena #4, Vals.ai #6) — app: claude.ai
- Muse Spark 1.2 by Meta — composite score 88.2/100 across 3 leaderboards (Vals.ai #1, LMArena #3, Artificial Analysis #6)
- Claude Fable 5 by Anthropic — composite score 78.8/100 across 4 leaderboards (LMArena #1, Artificial Analysis #2, LiveBench #2, Vals.ai #16) — app: claude.ai
- Kimi K3 by Kimi — composite score 71.4/100 across 6 leaderboards (Artificial Analysis #4, Vellum #5, LiveBench #6, LLM Stats #7, LMArena #8, Vals.ai #10) — app: Kimi AI
- GPT-5.6 Sol by OpenAI — composite score 69.4/100 across 6 leaderboards (LiveBench #1, LLM Stats #2, Artificial Analysis #3, Vellum #10, Vals.ai #12, LMArena #14) — app: ChatGPT
- GPT-5.6 Terra by OpenAI — composite score 68.3/100 across 3 leaderboards (LiveBench #5, Artificial Analysis #7, LLM Stats #10) — app: ChatGPT
- DeepSeek V4 Flash by DeepSeek — composite score 66.7/100 across 3 leaderboards (Vals.ai #3, Vellum #8, Artificial Analysis #12) — app: Deepseek
- Muse Spark 1.1 by Meta — composite score 61.8/100 across 2 leaderboards (LMArena #6, LiveBench #11)
- Grok 4.5 by SpaceXAI — composite score 60/100 across 4 leaderboards (Artificial Analysis #8, LLM Stats #9, Vals.ai #9, LiveBench #10) — app: Grok
- Claude Sonnet 5 by Anthropic — composite score 57.5/100 across 4 leaderboards (Vellum #4, Artificial Analysis #9, LiveBench #12, Vals.ai #13) — app: claude.ai
- Claude Opus 4.8 by Anthropic — composite score 57.4/100 across 5 leaderboards (Vellum #3, LLM Stats #5, LiveBench #7, LMArena #12, Vals.ai #20) — app: claude.ai
- GPT 5.5 by OpenAI — composite score 56.7/100 across 4 leaderboards (LiveBench #4, LLM Stats #6, LMArena #13, Vellum #15) — app: ChatGPT
- Gemini 3.1 Pro by Google — composite score 56.6/100 across 5 leaderboards (LLM Stats #3, LMArena #9, LiveBench #9, Vellum #13, Artificial Analysis #14) — app: Google Gemini
- Claude Opus 4.6 by Anthropic — composite score 46.6/100 across 3 leaderboards (LMArena #2, LLM Stats #16, Vellum #17) — app: claude.ai
- GPT 5.4 by OpenAI — composite score 45.4/100 across 3 leaderboards (LiveBench #8, LLM Stats #11, LMArena #16) — app: ChatGPT
- Gemini 3 Pro by Google — composite score 44.2/100 across 3 leaderboards (LMArena #10, Vellum #11, LLM Stats #15) — app: Google Gemini
- Gemini 3.6 Flash by Google — composite score 43.1/100 across 4 leaderboards (Vals.ai #8, LMArena #11, Artificial Analysis #13, LiveBench #17) — app: Google Gemini
- Kimi K2.6 by Moonshot AI — composite score 42.5/100 across 2 leaderboards (Vellum #7, LLM Stats #18) — app: Kimi AI
- GLM 5.2 by Z AI — composite score 40/100 across 5 leaderboards (Vellum #6, Artificial Analysis #10, Vals.ai #14, LLM Stats #17, LiveBench #18)
- GPT-5.6 Luna by OpenAI — composite score 38.3/100 across 3 leaderboards (Artificial Analysis #11, LLM Stats #14, LiveBench #15) — app: ChatGPT
- DeepSeek V4 Pro by DeepSeek — composite score 37.5/100 across 2 leaderboards (Vellum #9, Artificial Analysis #18) — app: Deepseek
- GPT-5.2 by OpenAI — composite score 30.4/100 across 2 leaderboards (LLM Stats #12, LMArena #17) — app: ChatGPT
- Gemini 3.5 Flash by Google — composite score 30.3/100 across 4 leaderboards (LiveBench #13, LMArena #15, Artificial Analysis #15, Vellum #16) — app: Google Gemini
- Inkling by Inkling — composite score 27.5/100 across 2 leaderboards (Vals.ai #11, LiveBench #20)
- Kimi K2.7 Code by Kimi — composite score 17.5/100 across 2 leaderboards (Vals.ai #15, Artificial Analysis #20) — app: Kimi AI
- MiniMax-M3 by MiniMax — composite score 15/100 across 2 leaderboards (Artificial Analysis #17, Vals.ai #19) — app: MiniMax
- Qwen3.7 by Alibaba — composite score 7.6/100 across 2 leaderboards (LMArena #19, LiveBench #19) — app: Qwen