Top AI Models Ranked Across 7 Leaderboards
The best AI models (LLMs) ranked by a composite of 7 independent leaderboards: LMArena, Artificial Analysis, LLM Stats, Design Arena, Vellum, LiveBench and Vals.ai. Updated daily and cross-referenced with the most popular AI apps.
Last updated: 2026-09-07
- Claude Fable 5.1 by Anthropic, composite score 94.6/100 across 4 leaderboards (Vellum #1, Artificial Analysis #1, LLM Stats #2, Vals.ai #4), app: claude.ai
- GPT-6 Astra by OpenAI, composite score 90/100 across 4 leaderboards (LLM Stats #1, Vals.ai #2, Artificial Analysis #2, Vellum #7), app: ChatGPT
- Muse Spark 1.3 by Meta, composite score 84.4/100 across 3 leaderboards (Vals.ai #1, Artificial Analysis #5, LLM Stats #5)
- Claude Fable 5 by Anthropic, composite score 83/100 across 5 leaderboards (LiveBench #1, LMArena #1, Artificial Analysis #4, Design Arena #7, LLM Stats #7), app: claude.ai
- Claude Opus 5 by Anthropic, composite score 75.3/100 across 6 leaderboards (Vellum #3, Artificial Analysis #3, LLM Stats #3, Design Arena #5, LMArena #5, Vals.ai #16), app: claude.ai
- Claude Opus 4.6 by Anthropic, composite score 66.7/100 across 3 leaderboards (LMArena #2, LiveBench #8, Design Arena #13), app: claude.ai
- GPT-5.6 Sol by OpenAI, composite score 66/100 across 5 leaderboards (Design Arena #2, LLM Stats #4, Artificial Analysis #6, LMArena #12, Vellum #14), app: ChatGPT
- GLM 5.3 Flash by Z AI, composite score 65/100 across 3 leaderboards (Design Arena #4, Vals.ai #5, Artificial Analysis #15)
- GLM 5.3 by Z AI, composite score 60.3/100 across 6 leaderboards (Design Arena #3, Vals.ai #6, Vellum #9, Artificial Analysis #9, LLM Stats #9, LMArena #15)
- Gemini 3.8 Flash by Google, composite score 59.2/100 across 4 leaderboards (Vals.ai #3, LMArena #4, Artificial Analysis #10, LLM Stats #15), app: Google Gemini
- Kimi K3 by Kimi, composite score 58.9/100 across 6 leaderboards (Design Arena #1, Vellum #8, LMArena #8, Artificial Analysis #8, LLM Stats #8, Vals.ai #20), app: Kimi AI
- Claude Opus 4.8 by Anthropic, composite score 58.8/100 across 4 leaderboards (LiveBench #2, Vellum #5, LMArena #13, LLM Stats #13), app: claude.ai
- Muse Spark 1.2 by Meta, composite score 58.8/100 across 4 leaderboards (LMArena #3, Design Arena #10, Vals.ai #12, Artificial Analysis #12)
- Grok 4.6 by SpaceXAI, composite score 58.3/100 across 3 leaderboards (Artificial Analysis #7, Vals.ai #10, Design Arena #11), app: Grok
- Gemini 3.1 Pro by Google, composite score 55/100 across 3 leaderboards (LiveBench #3, LMArena #10, Vellum #17), app: Google Gemini
- Qwen3.8 Max by Alibaba, composite score 52.8/100 across 3 leaderboards (Design Arena #6, Artificial Analysis #11, LLM Stats #11), app: Qwen
- Gemini 3.7 Flash by Google, composite score 52.5/100 across 4 leaderboards (LMArena #7, Design Arena #8, Vals.ai #9, Artificial Analysis #18), app: Google Gemini
- GLM 5.2 by Z.AI, composite score 48.3/100 across 3 leaderboards (Design Arena #9, Vellum #10, LiveBench #15)
- gpt-5.4 by OpenAI, composite score 47.5/100 across 2 leaderboards (LiveBench #4, LMArena #19), app: ChatGPT
- Muse Spark 1.1 by Meta, composite score 42.5/100 across 2 leaderboards (LMArena #6, Design Arena #19)
- DeepSeek V4 Pro by DeepSeek, composite score 40/100 across 5 leaderboards (Vals.ai #8, LLM Stats #10, LiveBench #13, Vellum #13, Design Arena #18), app: Deepseek
- Claude Opus 4.7 by Anthropic, composite score 40/100 across 2 leaderboards (LiveBench #6, Design Arena #20), app: claude.ai
- Gemini 3 Pro by Google, composite score 40/100 across 2 leaderboards (LMArena #11, Vellum #15), app: Google Gemini
- gpt-5.5 by OpenAI, composite score 38.3/100 across 3 leaderboards (LiveBench #7, LMArena #14, Vellum #19), app: ChatGPT
- Claude Sonnet 5 by Anthropic, composite score 37.5/100 across 4 leaderboards (Vellum #6, LiveBench #12, Design Arena #17, Artificial Analysis #19), app: claude.ai
- Gemini 3.5 Flash by Google, composite score 33.3/100 across 3 leaderboards (LiveBench #5, LMArena #18, Vellum #20), app: Google Gemini
- Kimi K2.6 by Moonshot AI, composite score 33.3/100 across 3 leaderboards (Vellum #11, Design Arena #15, LiveBench #17), app: Kimi AI
- GPT-5.6 Terra by OpenAI, composite score 33.3/100 across 2 leaderboards (LLM Stats #12, Artificial Analysis #13), app: ChatGPT
- DeepSeek V4 Flash by DeepSeek, composite score 31.7/100 across 3 leaderboards (Vellum #12, Vals.ai #13, LiveBench #19), app: Deepseek
- Gemini 3.6 Flash by Google, composite score 28.3/100 across 3 leaderboards (Design Arena #12, LMArena #16, Vals.ai #18), app: Google Gemini
- GPT-5.2 by OpenAI, composite score 27.5/100 across 2 leaderboards (LiveBench #11, LMArena #20), app: ChatGPT
- Grok 4.5 by SpaceXAI, composite score 18.3/100 across 3 leaderboards (Design Arena #16, Artificial Analysis #17, Vals.ai #19), app: Grok