| 1 | Z.ai: GLM 5.2 | 99,1% | 297,73 | 46 |
| 2 | Z.AI: GLM 4.7 Flash | 98,8% | 36,6 | 11 |
| 3 | Z.ai: GLM 5 Turbo | 98,5% | 456 | 73 |
| 3 | Z.ai: GLM 5V Turbo | 98,5% | 456 | 75 |
| 3 | Anthropic: Claude Fable 5 | 98,5% | 4 800 | 121 |
| 6 | Z.ai: GLM 5 | 98,2% | 324 | 60 |
| 7 | xAI: Grok 4.3 | 97,7% | 375 | 66 |
| 7 | Z.ai: GLM 5.1 | 97,7% | 356,04 | 61 |
| 9 | DeepSeek: DeepSeek V4 Pro | 96,2% | 130,5 | 21 |
| 10 | Z.AI: GLM 4.7 | 95,9% | 162 | 37 |
| 10 | MoonshotAI: Kimi K2.5 | 95,9% | 231 | 53 |
| 12 | Google: Gemini 3.1 Pro Preview | 95,6% | 1 080 | 91 |
| 13 | Google: Gemini 3.5 Flash | 95,3% | 810 | 82 |
| 14 | Anthropic: Claude Opus 4.8 | 94,4% | 2 400 | 111 |
| 15 | OpenAI: GPT-5.5 | 93,9% | 2 700 | 116 |
| 16 | MoonshotAI: Kimi K2 Thinking | 93% | 177 | 44 |
| 16 | xAI: Grok 4.20 | 93% | 375 | 65 |
| 18 | OpenAI: GPT-5.2-Codex | 92,1% | 1 155 | 104 |
| 19 | Arcee AI: Trinity Large Thinking | 90,1% | 93 | 40 |
| 20 | Anthropic: Claude Opus 4.7 | 88,6% | 2 400 | 113 |
| 21 | OpenAI: GPT-5.4 | 87,1% | 1 350 | 100 |
| 22 | MiniMax: MiniMax M2 | 86,8% | 96 | 23 |
| 22 | OpenAI: GPT-5 Codex | 86,8% | 825 | 90 |
| 24 | OpenAI: GPT-5.6 Terra | 86,3% | 1 350 | 95 |
| 24 | Anthropic: Claude Opus 4.5 | 86,3% | 2 400 | 120 |
| 26 | OpenAI: GPT-5.3-Codex | 86% | 1 155 | 98 |
| 27 | MiniMax: MiniMax M2.1 | 85,4% | 126 | 29 |
| 28 | OpenAI: GPT-5.6 Sol | 85,1% | 2 700 | 114 |
| 29 | OpenAI: GPT-5 | 84,8% | 825 | 93 |
| 29 | Anthropic: Claude Opus 4.6 | 84,8% | 2 400 | 119 |
| 29 | OpenAI: GPT-5.2 | 84,8% | 1 155 | 102 |
| 32 | OpenAI: GPT-5.4 Mini | 83,3% | 405 | 67 |
| 33 | OpenAI: GPT-5.1-Codex | 83% | 825 | 92 |
| 34 | OpenAI: GPT-5.1 | 81,9% | 825 | 89 |
| 35 | OpenAI: o3 | 80,7% | 840 | 103 |
| 36 | Anthropic: Claude Sonnet 4.6 | 79,5% | 1 440 | 110 |
| 36 | Qwen: Qwen3 Coder Next | 79,5% | 30,6 | 9 |
| 38 | DeepSeek: DeepSeek V3.2 | 78,9% | 69,6 | 19 |
| 39 | Z.AI: GLM 4.6 | 76,9% | 184,2 | 57 |
| 39 | Z.AI: GLM 4.6 (exacto) | 76,9% | 184,8 | 58 |
| 41 | OpenAI: GPT-5.4 Nano | 76% | 111 | 20 |
| 42 | Qwen: Qwen3 Max | 74,3% | 576 | 94 |
| 43 | MoonshotAI: Kimi K2 0905 (exacto) | 73,4% | 258 | 70 |
| 43 | MoonshotAI: Kimi K2 0905 | 73,4% | 184,2 | 56 |
| 45 | Anthropic: Claude Sonnet 4.5 | 70,5% | 1 440 | 117 |
| 46 | OpenAI: GPT-5 Mini | 68,4% | 165 | 52 |
| 47 | OpenAI: gpt-oss-120b | 65,8% | 18,42 | 2 |
| 47 | OpenAI: gpt-oss-120b (exacto) | 65,8% | 18,42 | 2 |
| 49 | OpenAI: GPT-5.1-Codex-Mini | 62,9% | 165 | 41 |
| 50 | OpenAI: o1 | 62,6% | 6 300 | 133 |
| 51 | MoonshotAI: Kimi K2 0711 | 61,1% | 192,48 | 64 |
| 52 | OpenAI: gpt-oss-20b | 60,2% | 13,8 | 5 |
| 52 | OpenAI: gpt-oss-20b (free) | 60,2% | | |
| 54 | Google: Gemma 4 31B | 59,9% | 43,8 | 10 |
| 55 | OpenAI: o4 Mini High | 55,6% | 462 | 86 |
| 55 | OpenAI: o4 Mini | 55,6% | 462 | 86 |
| 57 | Google: Gemini 2.5 Pro | 54,1% | 825 | 107 |
| 58 | OpenAI: GPT-4.1 Mini | 52,9% | 168 | 71 |
| 59 | Anthropic: Claude Sonnet 4 | 52,3% | 1 440 | 118 |
| 60 | OpenAI: GPT-4.1 | 47,1% | 840 | 112 |
| 60 | DeepSeek: DeepSeek V3 0324 | 47,1% | 88,8 | 47 |
| 62 | Z.AI: GLM 4.5 Air | 46,5% | 59,52 | 26 |
| 63 | Google: Gemma 4 26B A4B | 43,6% | 33 | 8 |
| 64 | Z.AI: GLM 4.5 | 43% | 156 | 59 |
| 65 | Mistral: Mistral Medium 3.1 | 40,6% | 192 | 76 |
| 66 | DeepSeek: DeepSeek V3.1 Terminus | 37,1% | 85,2 | 30 |
| 66 | DeepSeek: DeepSeek V3.1 Terminus (exacto) | 37,1% | 85,2 | 30 |
| 68 | OpenAI: GPT-5 Nano | 36,5% | 33 | 12 |
| 68 | DeepSeek: R1 | 36,5% | 126 | 49 |
| 70 | Qwen: Qwen3 VL 235B A22B Instruct | 35,1% | 108 | 55 |
| 71 | DeepSeek: DeepSeek V3.1 | 34,8% | 72 | 24 |
| 72 | Qwen: Qwen3 Coder 30B A3B Instruct | 34,5% | 28,8 | 16 |
| 72 | Qwen2.5 72B Instruct | 34,5% | 45 | 38 |
| 74 | Qwen: Qwen3 235B A22B Instruct 2507 | 33,3% | 40,56 | 18 |
| 75 | Mistral Large 2407 | 33% | 720 | 123 |
| 76 | Anthropic: Claude Haiku 4.5 | 32,5% | 480 | 88 |
| 77 | Google: Gemini 3.1 Flash Lite | 31,3% | 135 | 42 |
| 77 | OpenAI: o3 Mini High | 31,3% | 462 | 105 |
| 77 | Google: Gemini 3.1 Flash Lite Preview | 31,3% | 135 | 42 |
| 80 | Z.AI: GLM 4.6V | 30,7% | 108 | 68 |
| 81 | Qwen: Qwen3 VL 8B Instruct | 29,2% | 35,52 | 34 |
| 81 | Qwen: Qwen3 VL 32B Instruct | 29,2% | 180 | 83 |
| 83 | OpenAI: GPT-4o (2024-08-06) | 28,9% | 1 050 | 124 |
| 84 | OpenAI: o3 Mini | 28,7% | 462 | 96 |
| 85 | Llama: Llama 3.3 70B Instruct | 26,6% | 37,2 | 32 |
| 86 | NVIDIA: Nemotron 3 Nano 30B A3B | 25,4% | 25,2 | 25 |
| 87 | OpenAI: GPT-4o | 25,1% | 1 050 | 122 |
| 88 | Mistral: Mistral Medium 3 | 24,3% | 192 | 81 |
| 89 | DeepSeek: DeepSeek V3 | 22,8% | 126 | 62 |
| 90 | DeepSeek: R1 Distill Llama 70B | 21,9% | 12 | 6 |
| 91 | Qwen: Qwen3 Next 80B A3B Instruct | 21,6% | 82,2 | 48 |
| 92 | Anthropic: Claude 3 Haiku | 21,1% | 120 | 108 |
| 92 | Llama: Llama 3.2 3B Instruct | 21,1% | 4,8 | 7 |
| 94 | Mistral: Mistral Small 3 | 19,6% | 12 | 14 |
| 94 | Z.AI: GLM 4.5V | 19,6% | 172,8 | 99 |
| 96 | Google: Gemini 2.5 Flash Lite | 19% | 42 | 50 |
| 96 | Qwen: Qwen3 VL 30B A3B Instruct | 19% | 63 | 51 |
| 98 | Llama: Llama 4 Maverick | 17,8% | 63 | 35 |
| 99 | OpenAI: GPT-4.1 Nano | 17,3% | 42 | 36 |
| 100 | Llama: Llama 3.1 8B Instruct | 16,4% | 6,6 | 4 |
| 101 | Llama: Llama 4 Scout | 15,5% | 32,4 | 22 |
| 102 | Llama: Llama 3.1 70B Instruct | 15,2% | 96 | 79 |
| 102 | Cohere: Command A | 15,2% | 1 050 | 125 |
| 104 | Google: Gemini 2.5 Flash | 14,9% | 204 | 78 |
| 105 | AI21: Jamba Large 1.7 | 13,5% | 840 | 127 |
| 106 | IBM: Granite 4.0 Micro | 12,6% | 9,66 | 39 |
| 107 | Google: Gemma 3 12B | 10,8% | 11,4 | 15 |
| 108 | Google: Gemma 3 27B | 10,5% | 16,2 | 17 |
| 109 | Qwen: Qwen3 30B A3B Instruct 2507 | 10,2% | 34,2 | 28 |
| 110 | Google: Gemma 3 4B | 5% | 7,15 | 54 |
| 111 | Llama: Llama 3.2 1B Instruct | 0% | 16,86 | 84 |
| 111 | Microsoft: Phi 4 | 0% | 19,2 | 33 |