🛡️
Session Flagged

Your session has been flagged for unusual activity.

You can try our app by searching for MultipleChat AI on Google and clicking the multiplechat.ai link to try it free.
Verificación rápida

Confirma que eres una persona para continuar.


Modelos de frontera, evaluados continuamente.

Calidad, coste y velocidad de los mejores modelos de IA — actualizados en ciclo continuo · última actualización 2026-08-23.

Índices de inteligencia, código y agentes

Índices compuestos de Artificial Analysis · precio por millón de tokens (entrada / salida)

# Modelo Inteligencia Código Agentes $ / 1M entrada $ / 1M salida
1 Claude Opus 5 (Adaptive Reasoning, Max Effort) 63.1 78 59.2 $5.50 $27.50
2 Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback) 62.1 76.5 56.6 $11.00 $55.00
3 GPT-5.6 Sol (max) 60.9 77.4 57.8 $5.50 $33.00
4 Grok 4.6 (high) 60.9 76.8 58.7 $2.00 $6.00
5 Kimi K3 (max) 59.7 76.2 54.3 $2.80 $14.00
6 GLM-5.3 (max) 59.5 74.8 59.1 $1.40 $4.40
7 Qwen3.8 Max 58.1 71.8 58.4 $2.00 $6.00
8 Qwen3.8 2.4T A95B 57.7 71.9 57.1 $2.00 $6.00
9 Claude Opus 4.8 (Adaptive Reasoning, Max Effort) 57.3 74.3 49.4 $5.50 $27.50
10 Muse Spark 1.2 (xhigh) 56.8 72.2 49.3 $1.25 $4.25
11 GPT-5.6 Terra (max) 56.6 76.7 50.2 $2.20 $13.20
12 GPT-5.5 (xhigh) 56.3 74.9 47.4 $5.50 $33.00
13 Gemini 3.7 Flash (high) 56 76.1 45.1 $0.190 $0.940
14 Grok 4.5 (high) 55.8 72.4 48.9 $2.00 $6.00
15 Claude Sonnet 5 (Adaptive Reasoning, Max Effort) 55.3 71.5 49.7 $2.20 $11.00
16 Claude Opus 4.7 (Adaptive Reasoning, Max Effort) 55 73.6 46.3 $5.50 $27.50
17 Muse Spark 1.1 (xhigh) 53.2 71.3 39.7 $1.25 $4.25
18 DeepSeek V4 Pro 0813 (Reasoning, Max Effort) 53.2 68.8 49.6 $1.32 $3.96
19 GPT-5.4 (xhigh) 53.1 71.1 44.2 $2.75 $16.50
20 GLM-5.2 (max) 52.6 68.8 45.7 $0.500 $3.15
21 GPT-5.6 Luna (max) 52.3 71.4 46.9 $0.220 $1.32
22 Gemini 3.5 Flash (high) 52 70.1 39.7 $1.65 $9.90
23 Qwen3.8 27B 52 68.1 50.9 $0.400 $3.00
24 DeepSeek V4 Flash 0731 (Reasoning, Max Effort) 51.8 69.1 48.4 $0.050 $0.100
25 Gemini 3.6 Flash (high) 51.6 69.2 40.5 $0.830 $4.12
26 Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort) 48.4 63 42.1 $3.30 $16.50
27 Gemini 3.1 Pro Preview 47.7 68.8 23 $2.00 $12.00
28 Qwen3.7 Max 46.7 66 30.9 $1.48 $4.42
29 MiniMax-M3 45.4 58.6 36.1 $0.280 $1.10
30 DeepSeek V4 Pro (Reasoning, Max Effort) 45.3 59.4 37.8 $0.410 $0.810

Razonamiento, agentes y búsqueda — reejecutados en modelos actuales

GPQA Diamond

Graduate-level science reasoning

# Modelo Puntuación $ / tarea
1 Gemini 3.1 Pro Preview 94.3% $0.204
2 GPT-5.6 Sol Pro 93.8% $0.445
3 GPT-5.5 93.3% $0.303
4 Gemini 3.5 Flash 93.1% $0.137
5 Gemini 3.6 Flash 92.4% $0.090
6 Gemini 3.7 Flash 92.3% $0.015
7 GPT-5.6 Sol 91.4% $0.104
8 Kimi K3 91.3% $0.134
9 GPT-5.6 Luna Pro 90.7% $0.047
10 MiniMax M3 90.5% $0.028
11 GPT-5.4 90.4% $0.153
12 Nova Micro 1.0 89.7% $0.206
13 GPT-5.6 Terra 89.6% $0.021
14 Claude Opus 4.7 88.7% $0.225
15 Claude Opus 4.8 88.6% $0.189

Ningún modelo gana todos los benchmarks.

El líder cambia según la tarea: un modelo domina el razonamiento, otro el código y un tercero la búsqueda agéntica. Exactamente por eso existe MultipleChat — pon a los líderes lado a lado, deja que redacten, se cuestionen y se verifiquen, y quédate con la mejor respuesta.

Calidad, coste y velocidad juntos

Una puntuación sin precio es marketing. Cada leaderboard aquí combina calidad con coste por tarea o por millón de tokens.

En vivo y abierto

Actualizado continuamente y descargable en JSON. Nuestro estudio comparativo trimestral está en el MultipleChat AI Benchmark.

Atribución

Source: OpenRouter (openrouter.ai/rankings) incl. los índices de Artificial Analysis, as of 2026-08-23T20:53:36Z. Con licencia CC BY 4.0.