Rank AI models by benchmark scores and compare performance across development stages and model families.
| Rank | Model | Family | Avg ▾ | MMLU ▾ | HumanEval ▾ | MBPP ▾ | GSM8K ▾ | MATH ▾ | MT-Bench ▾ | HellaSwag ▾ | ARC-Challenge ▾ | TruthfulQA ▾ | GPQA Diamond ▾ |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| #1 | DeepSeek R1 deepseek-r1 | 89% | 90.8% | 92.9% | 90.2% | 97.3% | 97.3% | 9.4/10 | 89.7% | 97.1% | 67% | 71.5% | |
| #2 | Qwen 3 235B qwen3-235b | 88% | 90.1% | 92% | 91.2% | 97.8% | 92.7% | 9.3/10 | 90.1% | 97.2% | 67.5% | 65% | |
| #3 | DeepSeek V3 deepseek-v3 | 85% | 88.5% | 89.3% | 89.7% | 97.3% | 80.7% | 9.3/10 | 88.9% | 96.4% | 64.2% | 59.1% | |
| #4 | DeepSeek R1 Distill 32B deepseek-r1-distill-qwen-32b | 85% | 87.2% | 88.2% | 87.5% | 96.4% | 94.3% | 9.1/10 | 87.9% | 95.6% | 63.1% | 60% | |
| #5 | Qwen 3 32B qwen3-32b | 85% | 87.6% | 90.5% | 89.8% | 96.5% | 90% | 9.1/10 | 88.5% | 95.7% | 64% | 58% | |
| #6 | Llama 3.1 405B llama-3.1-405b | 83% | 88.6% | 89% | 88.6% | 96.8% | 73.8% | 9.1/10 | 89.5% | 96.9% | 63.8% | 51.1% | |
| #7 | Qwen 2.5 72B qwen2.5-72b | 82% | 86.1% | 86% | 88.3% | 93.2% | 83.1% | 9.1/10 | 87.8% | 94.8% | 60.5% | 49% | |
| #8 | Phi-4 14B phi-4 | 81% | 84.8% | 82.6% | 83% | 95.8% | 80.4% | 8.8/10 | 84.8% | 94% | 60.9% | 56.1% | |
| #9 | Llama 3.3 70B llama-3.3-70b | 80% | 86.3% | 82.3% | 85.1% | 95.6% | 69.4% | 8.8/10 | 88.6% | 95.1% | 60.1% | 47.3% | |
| #10 | Llama 3.1 70B llama-3.1-70b | 79% | 86% | 80.5% | 84% | 95.1% | 68% | 8.7/10 | 88% | 94.8% | 59.2% | 46.7% | |
| #11 | Mistral Large 2 mistral-large-2 | 79% | 84% | 92% | 84% | 93% | 69.9% | 8.6/10 | 86% | 94% | 57.4% | 43% | |
| #12 | Gemma 3 27B gemma-3-27b | 77% | 81% | 78% | 79.5% | 91.4% | 67.6% | 8.8/10 | 89% | 92% | 62% | 46% | |
| #13 | Mixtral 8×22B mixtral-8x22b | 73% | 77.8% | 75.1% | 74% | 88.2% | 56.6% | 8.7/10 | 88.7% | 91.3% | 51% | 38.5% | |
| #14 | Gemma 3 12B gemma-3-12b | 73% | 77.5% | 72% | 74% | 87% | 57% | 8.5/10 | 87% | 89.5% | 58% | 40% | |
| #15 | Phi-3.5 MoE phi-3.5-moe | 73% | 78.9% | 75% | 71% | 88.7% | 65% | 8.3/10 | 83% | 89% | 55% | 40% | |
| #16 | OLMo 2 32B olmo-2-32b | 71% | 78.1% | 68% | 70% | 87% | 54% | 8.2/10 | 85.5% | 89.5% | 58% | 38% | |
| #17 | Gemma 2 27B gemma-2-27b | 71% | 75.2% | 71.7% | 74% | 86.6% | 50.4% | 8.4/10 | 88.4% | 90% | 54% | 38.2% | |
| #18 | Command R+ 104B command-r-plus | 69% | 75.7% | 61.2% | 65% | 87.4% | 54.5% | 8.5/10 | 84% | 88% | 56% | 37.5% | |
| #19 | Llama 3.2 11B llama-3.2-11b | 69% | 73% | 72.6% | 70% | 84.5% | 51.5% | 7.8/10 | 83% | 88.7% | 56.4% | 35.2% | |
| #20 | Mistral NeMo 12B mistral-nemo-12b | 62% | 68% | 68% | 60% | 74% | 29% | 7.9/10 | 82% | 81% | 48% | 31% | |
| #21 | Gemma 3 4B gemma-3-4b | 55% | 59.6% | 48% | 55% | 60% | 30.5% | 7.4/10 | 78% | 75% | 48% | 26% | |
| #22 | Mistral 7B v0.3 mistral-7b-v0.3 | 52% | 64.2% | 37.8% | 53% | 52.2% | 14.1% | 7.6/10 | 81.3% | 73.2% | 42.2% | 28% | |
| #23 | Falcon 180B falcon-180b | 50% | 70.4% | 18% | 38% | 56.4% | 12% | 7/10 | 88.9% | 78% | 45% | 24% |