Лучшая нейросеть для агентов и вызова инструментов

Модели упорядочены по результату бенчмарка τ²-bench — многошаговые задачи с вызовом инструментов от лица пользователя.

МестоМодельИнструменты и агентыЦена, ₽ за 1M токенов (3:1)Место по выгоде
1Z.ai: GLM 5.299,1%297,7346
2Z.AI: GLM 4.7 Flash98,8%36,611
3Z.ai: GLM 5 Turbo98,5%45673
3Z.ai: GLM 5V Turbo98,5%45675
3Anthropic: Claude Fable 598,5%4 800121
6Z.ai: GLM 598,2%32460
7xAI: Grok 4.397,7%37566
7Z.ai: GLM 5.197,7%356,0461
9DeepSeek: DeepSeek V4 Pro96,2%130,521
10Z.AI: GLM 4.795,9%16237
10MoonshotAI: Kimi K2.595,9%23153
12Google: Gemini 3.1 Pro Preview95,6%1 08091
13Google: Gemini 3.5 Flash95,3%81082
14Anthropic: Claude Opus 4.894,4%2 400111
15OpenAI: GPT-5.593,9%2 700116
16MoonshotAI: Kimi K2 Thinking93%17744
16xAI: Grok 4.2093%37565
18OpenAI: GPT-5.2-Codex92,1%1 155104
19Arcee AI: Trinity Large Thinking90,1%9340
20Anthropic: Claude Opus 4.788,6%2 400113
21OpenAI: GPT-5.487,1%1 350100
22MiniMax: MiniMax M286,8%9623
22OpenAI: GPT-5 Codex86,8%82590
24OpenAI: GPT-5.6 Terra86,3%1 35095
24Anthropic: Claude Opus 4.586,3%2 400120
26OpenAI: GPT-5.3-Codex86%1 15598
27MiniMax: MiniMax M2.185,4%12629
28OpenAI: GPT-5.6 Sol85,1%2 700114
29OpenAI: GPT-584,8%82593
29Anthropic: Claude Opus 4.684,8%2 400119
29OpenAI: GPT-5.284,8%1 155102
32OpenAI: GPT-5.4 Mini83,3%40567
33OpenAI: GPT-5.1-Codex83%82592
34OpenAI: GPT-5.181,9%82589
35OpenAI: o380,7%840103
36Anthropic: Claude Sonnet 4.679,5%1 440110
36Qwen: Qwen3 Coder Next79,5%30,69
38DeepSeek: DeepSeek V3.278,9%69,619
39Z.AI: GLM 4.676,9%184,257
39Z.AI: GLM 4.6 (exacto)76,9%184,858
41OpenAI: GPT-5.4 Nano76%11120
42Qwen: Qwen3 Max74,3%57694
43MoonshotAI: Kimi K2 0905 (exacto)73,4%25870
43MoonshotAI: Kimi K2 090573,4%184,256
45Anthropic: Claude Sonnet 4.570,5%1 440117
46OpenAI: GPT-5 Mini68,4%16552
47OpenAI: gpt-oss-120b65,8%18,422
47OpenAI: gpt-oss-120b (exacto)65,8%18,422
49OpenAI: GPT-5.1-Codex-Mini62,9%16541
50OpenAI: o162,6%6 300133
51MoonshotAI: Kimi K2 071161,1%192,4864
52OpenAI: gpt-oss-20b60,2%13,85
52OpenAI: gpt-oss-20b (free)60,2%
54Google: Gemma 4 31B59,9%43,810
55OpenAI: o4 Mini High55,6%46286
55OpenAI: o4 Mini55,6%46286
57Google: Gemini 2.5 Pro54,1%825107
58OpenAI: GPT-4.1 Mini52,9%16871
59Anthropic: Claude Sonnet 452,3%1 440118
60OpenAI: GPT-4.147,1%840112
60DeepSeek: DeepSeek V3 032447,1%88,847
62Z.AI: GLM 4.5 Air46,5%59,5226
63Google: Gemma 4 26B A4B43,6%338
64Z.AI: GLM 4.543%15659
65Mistral: Mistral Medium 3.140,6%19276
66DeepSeek: DeepSeek V3.1 Terminus37,1%85,230
66DeepSeek: DeepSeek V3.1 Terminus (exacto)37,1%85,230
68OpenAI: GPT-5 Nano36,5%3312
68DeepSeek: R136,5%12649
70Qwen: Qwen3 VL 235B A22B Instruct35,1%10855
71DeepSeek: DeepSeek V3.134,8%7224
72Qwen: Qwen3 Coder 30B A3B Instruct34,5%28,816
72Qwen2.5 72B Instruct34,5%4538
74Qwen: Qwen3 235B A22B Instruct 250733,3%40,5618
75Mistral Large 240733%720123
76Anthropic: Claude Haiku 4.532,5%48088
77Google: Gemini 3.1 Flash Lite31,3%13542
77OpenAI: o3 Mini High31,3%462105
77Google: Gemini 3.1 Flash Lite Preview31,3%13542
80Z.AI: GLM 4.6V30,7%10868
81Qwen: Qwen3 VL 8B Instruct29,2%35,5234
81Qwen: Qwen3 VL 32B Instruct29,2%18083
83OpenAI: GPT-4o (2024-08-06)28,9%1 050124
84OpenAI: o3 Mini28,7%46296
85Llama: Llama 3.3 70B Instruct26,6%37,232
86NVIDIA: Nemotron 3 Nano 30B A3B25,4%25,225
87OpenAI: GPT-4o25,1%1 050122
88Mistral: Mistral Medium 324,3%19281
89DeepSeek: DeepSeek V322,8%12662
90DeepSeek: R1 Distill Llama 70B21,9%126
91Qwen: Qwen3 Next 80B A3B Instruct21,6%82,248
92Anthropic: Claude 3 Haiku21,1%120108
92Llama: Llama 3.2 3B Instruct21,1%4,87
94Mistral: Mistral Small 319,6%1214
94Z.AI: GLM 4.5V19,6%172,899
96Google: Gemini 2.5 Flash Lite19%4250
96Qwen: Qwen3 VL 30B A3B Instruct19%6351
98Llama: Llama 4 Maverick17,8%6335
99OpenAI: GPT-4.1 Nano17,3%4236
100Llama: Llama 3.1 8B Instruct16,4%6,64
101Llama: Llama 4 Scout15,5%32,422
102Llama: Llama 3.1 70B Instruct15,2%9679
102Cohere: Command A15,2%1 050125
104Google: Gemini 2.5 Flash14,9%20478
105AI21: Jamba Large 1.713,5%840127
106IBM: Granite 4.0 Micro12,6%9,6639
107Google: Gemma 3 12B10,8%11,415
108Google: Gemma 3 27B10,5%16,217
109Qwen: Qwen3 30B A3B Instruct 250710,2%34,228
110Google: Gemma 3 4B5%7,1554
111Llama: Llama 3.2 1B Instruct0%16,8684
111Microsoft: Phi 40%19,233
Топ-10: инструменты и агентыZ.ai: GLM 5.2 — 99,1%, Z.AI: GLM 4.7 Flash — 98,8%, Z.ai: GLM 5 Turbo — 98,5%, Z.ai: GLM 5V Turbo — 98,5%, Anthropic: Claude Fable 5 — 98,5%, Z.ai: GLM 5 — 98,2%, xAI: Grok 4.3 — 97,7%, Z.ai: GLM 5.1 — 97,7%, DeepSeek: DeepSeek V4 Pro — 96,2%, Z.AI: GLM 4.7 — 95,9%

В рейтинге 112 моделей, по которым есть рыночные данные, — из 525 видимых в каталоге Apikley. У остальных моделей каталога измерений нет, поэтому в рейтинг они не попадают.

Метрики бенчмарков: Artificial Analysis. Цены — Apikley, в рублях, смешанная стоимость входа и выхода в пропорции 3:1.

Другие рейтинги моделей

Все AI-модели каталога Apikley — доступ через API из России, оплата в рублях, без VPN.