| 1 | Z.AI: GLM 4.7 | 89,4% | 162 | 37 |
| 2 | OpenAI: GPT-5.2 | 88,9% | 1 155 | 102 |
| 3 | OpenAI: gpt-oss-120b | 87,8% | 18,42 | 2 |
| 3 | OpenAI: gpt-oss-120b (exacto) | 87,8% | 18,42 | 2 |
| 5 | OpenAI: GPT-5.1 | 86,8% | 825 | 89 |
| 6 | OpenAI: o4 Mini High | 85,9% | 462 | 86 |
| 6 | OpenAI: o4 Mini | 85,9% | 462 | 86 |
| 8 | MoonshotAI: Kimi K2 Thinking | 85,3% | 177 | 44 |
| 9 | OpenAI: GPT-5.1-Codex | 84,9% | 825 | 92 |
| 10 | OpenAI: GPT-5 | 84,6% | 825 | 93 |
| 11 | OpenAI: GPT-5 Codex | 84% | 825 | 90 |
| 12 | OpenAI: GPT-5 Mini | 83,8% | 165 | 52 |
| 13 | OpenAI: GPT-5.1-Codex-Mini | 83,6% | 165 | 41 |
| 14 | MiniMax: MiniMax M2 | 82,6% | 96 | 23 |
| 15 | MiniMax: MiniMax M2.1 | 81% | 126 | 29 |
| 16 | OpenAI: o3 | 80,8% | 840 | 103 |
| 17 | Google: Gemini 2.5 Pro | 80,1% | 825 | 107 |
| 18 | OpenAI: GPT-5 Nano | 78,9% | 33 | 12 |
| 19 | OpenAI: gpt-oss-20b | 77,7% | 13,8 | 5 |
| 19 | OpenAI: gpt-oss-20b (free) | 77,7% | | |
| 21 | DeepSeek: R1 | 77% | 126 | 49 |
| 22 | Qwen: Qwen3 Max | 76,7% | 576 | 94 |
| 23 | Z.AI: GLM 4.5 | 73,8% | 156 | 59 |
| 23 | Anthropic: Claude Opus 4.5 | 73,8% | 2 400 | 120 |
| 25 | OpenAI: o3 Mini High | 73,4% | 462 | 105 |
| 26 | OpenAI: o3 Mini | 71,7% | 462 | 96 |
| 27 | Qwen: Qwen3 Next 80B A3B Instruct | 68,4% | 82,2 | 48 |
| 27 | Z.AI: GLM 4.5 Air | 68,4% | 59,52 | 26 |
| 29 | OpenAI: o1 | 67,9% | 6 300 | 133 |
| 30 | MoonshotAI: Kimi K2 0905 (exacto) | 61% | 258 | 70 |
| 30 | MoonshotAI: Kimi K2 0905 | 61% | 184,2 | 56 |
| 32 | Qwen: Qwen3 VL 235B A22B Instruct | 59,4% | 108 | 55 |
| 33 | DeepSeek: DeepSeek V3.2 | 59,3% | 69,6 | 19 |
| 34 | Anthropic: Claude Sonnet 4.5 | 59% | 1 440 | 117 |
| 35 | DeepSeek: DeepSeek V3.1 | 57,7% | 72 | 24 |
| 36 | Z.AI: GLM 4.6 | 56,1% | 184,2 | 57 |
| 36 | Z.AI: GLM 4.6 (exacto) | 56,1% | 184,8 | 58 |
| 38 | MoonshotAI: Kimi K2 0711 | 55,6% | 192,48 | 64 |
| 39 | Anthropic: Claude Opus 4 | 54,2% | 7 200 | 134 |
| 40 | DeepSeek: DeepSeek V3.1 Terminus | 52,9% | 85,2 | 30 |
| 40 | DeepSeek: DeepSeek V3.1 Terminus (exacto) | 52,9% | 85,2 | 30 |
| 42 | Qwen: Qwen3 235B A22B Instruct 2507 | 52,4% | 40,56 | 18 |
| 43 | Qwen: Qwen3 30B A3B Instruct 2507 | 51,5% | 34,2 | 28 |
| 44 | Qwen: Qwen3 VL 32B Instruct | 51,4% | 180 | 83 |
| 45 | Anthropic: Claude Haiku 4.5 | 51,1% | 480 | 88 |
| 46 | Google: Gemini 2.5 Flash | 49,5% | 204 | 78 |
| 47 | OpenAI: GPT-4.1 Mini | 48,3% | 168 | 71 |
| 48 | Qwen: Qwen3 VL 30B A3B Instruct | 47,6% | 63 | 51 |
| 49 | OpenAI: GPT-4.1 | 45,7% | 840 | 112 |
| 50 | Anthropic: Claude Sonnet 4 | 44,9% | 1 440 | 118 |
| 51 | Z.AI: GLM 4.6V | 41,1% | 108 | 68 |
| 52 | Mistral: Mistral Medium 3.1 | 40,6% | 192 | 76 |
| 53 | DeepSeek: DeepSeek V3 0324 | 40,5% | 88,8 | 47 |
| 54 | Qwen: Qwen3 Coder 30B A3B Instruct | 40,3% | 28,8 | 16 |
| 55 | Mistral: Mistral Medium 3 | 40% | 192 | 81 |
| 55 | Google: Gemini 2.5 Flash Lite | 40% | 42 | 50 |
| 57 | Llama: Llama 4 Maverick | 39,7% | 63 | 35 |
| 58 | NVIDIA: Nemotron 3 Nano 30B A3B | 36% | 25,2 | 25 |
| 59 | DeepSeek: DeepSeek V3 | 35,9% | 126 | 62 |
| 60 | Z.AI: GLM 4.5V | 35,2% | 172,8 | 99 |
| 61 | OpenAI: GPT-4o (2024-05-13) | 33,4% | 1 800 | 130 |
| 62 | Qwen: Qwen3 VL 8B Instruct | 33,2% | 35,52 | 34 |
| 63 | OpenAI: GPT-4.1 Nano | 32,6% | 42 | 36 |
| 64 | OpenAI: GPT-4o (2024-08-06) | 31,7% | 1 050 | 124 |
| 65 | OpenAI: GPT-4o | 30,9% | 1 050 | 122 |
| 66 | Llama: Llama 4 Scout | 29,9% | 32,4 | 22 |
| 67 | Qwen2.5 Coder 32B Instruct | 29,5% | 12 | 13 |
| 67 | Perplexity: Sonar | 29,5% | 240 | 101 |
| 69 | OpenAI: GPT-4 Turbo | 29,1% | 3 600 | 135 |
| 70 | Llama: Llama 3.3 70B Instruct | 28,8% | 37,2 | 32 |
| 71 | Cohere: Command A | 28,7% | 1 050 | 125 |
| 72 | Qwen2.5 72B Instruct | 27,6% | 45 | 38 |
| 73 | Perplexity: Sonar Pro | 27,5% | 1 440 | 126 |
| 74 | Mistral Large 2407 | 26,7% | 720 | 123 |
| 75 | DeepSeek: R1 Distill Llama 70B | 26,6% | 12 | 6 |
| 76 | Mistral: Mistral Small 3 | 25,2% | 12 | 14 |
| 77 | OpenAI: GPT-4o-mini | 23,4% | 63 | 63 |
| 78 | Llama: Llama 3.1 70B Instruct | 23,2% | 96 | 79 |
| 79 | Microsoft: Phi 4 | 23,1% | 19,2 | 33 |
| 80 | Nous: Hermes 3 70B Instruct | 18,8% | 72 | 80 |
| 81 | AI21: Jamba Large 1.7 | 18,1% | 840 | 127 |
| 82 | IBM: Granite 4.0 Micro | 18% | 9,66 | 39 |
| 83 | Mistral Large | 17,8% | 720 | 128 |
| 84 | Anthropic: Claude 3 Haiku | 15,4% | 120 | 108 |
| 85 | Mistral: Mixtral 8x22B Instruct | 14,8% | 720 | 129 |
| 86 | Google: Gemma 3 12B | 13,7% | 11,4 | 15 |
| 86 | Google: Gemma 3 27B | 13,7% | 16,2 | 17 |
| 88 | Llama: Llama 3.1 8B Instruct | 11,6% | 6,6 | 4 |
| 89 | Google: Gemma 3 4B | 11,2% | 7,15 | 54 |
| 90 | Llama: Llama 3.2 3B Instruct | 8,3% | 4,8 | 7 |
| 91 | Llama: Llama 3.2 1B Instruct | 1,9% | 16,86 | 84 |