🛡️
Session Flagged

Your session has been flagged for unusual activity.

You can try our app by searching for MultipleChat AI on Google and clicking the multiplechat.ai link to try it free.
Vérification rapide

Merci de confirmer que vous êtes bien humain pour continuer.


Les modèles de pointe, benchmarkés en continu.

Qualité, coût et vitesse des meilleurs modèles d'IA — actualisés en continu · dernière mise à jour 2026-08-23.

Indices d'intelligence, de code et d'agents

Indices composites d'Artificial Analysis · prix par million de tokens (entrée / sortie)

# Modèle Intelligence Code Agents $ / 1M entrée $ / 1M sortie
1 Claude Opus 5 (Adaptive Reasoning, Max Effort) 63.1 78 59.2 $5.50 $27.50
2 Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback) 62.1 76.5 56.6 $11.00 $55.00
3 GPT-5.6 Sol (max) 60.9 77.4 57.8 $5.50 $33.00
4 Grok 4.6 (high) 60.9 76.8 58.7 $2.00 $6.00
5 Kimi K3 (max) 59.7 76.2 54.3 $2.80 $14.00
6 GLM-5.3 (max) 59.5 74.8 59.1 $1.40 $4.40
7 Qwen3.8 Max 58.1 71.8 58.4 $2.00 $6.00
8 Qwen3.8 2.4T A95B 57.7 71.9 57.1 $2.00 $6.00
9 Claude Opus 4.8 (Adaptive Reasoning, Max Effort) 57.3 74.3 49.4 $5.50 $27.50
10 Muse Spark 1.2 (xhigh) 56.8 72.2 49.3 $1.25 $4.25
11 GPT-5.6 Terra (max) 56.6 76.7 50.2 $2.20 $13.20
12 GPT-5.5 (xhigh) 56.3 74.9 47.4 $5.50 $33.00
13 Gemini 3.7 Flash (high) 56 76.1 45.1 $0.190 $0.940
14 Grok 4.5 (high) 55.8 72.4 48.9 $2.00 $6.00
15 Claude Sonnet 5 (Adaptive Reasoning, Max Effort) 55.3 71.5 49.7 $2.20 $11.00
16 Claude Opus 4.7 (Adaptive Reasoning, Max Effort) 55 73.6 46.3 $5.50 $27.50
17 Muse Spark 1.1 (xhigh) 53.2 71.3 39.7 $1.25 $4.25
18 DeepSeek V4 Pro 0813 (Reasoning, Max Effort) 53.2 68.8 49.6 $1.32 $3.96
19 GPT-5.4 (xhigh) 53.1 71.1 44.2 $2.75 $16.50
20 GLM-5.2 (max) 52.6 68.8 45.7 $0.500 $3.15
21 GPT-5.6 Luna (max) 52.3 71.4 46.9 $0.220 $1.32
22 Gemini 3.5 Flash (high) 52 70.1 39.7 $1.65 $9.90
23 Qwen3.8 27B 52 68.1 50.9 $0.400 $3.00
24 DeepSeek V4 Flash 0731 (Reasoning, Max Effort) 51.8 69.1 48.4 $0.050 $0.100
25 Gemini 3.6 Flash (high) 51.6 69.2 40.5 $0.830 $4.12
26 Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort) 48.4 63 42.1 $3.30 $16.50
27 Gemini 3.1 Pro Preview 47.7 68.8 23 $2.00 $12.00
28 Qwen3.7 Max 46.7 66 30.9 $1.48 $4.42
29 MiniMax-M3 45.4 58.6 36.1 $0.280 $1.10
30 DeepSeek V4 Pro (Reasoning, Max Effort) 45.3 59.4 37.8 $0.410 $0.810

Raisonnement, agents et recherche — relancés sur les modèles actuels

GPQA Diamond

Graduate-level science reasoning

# Modèle Score $ / tâche
1 Gemini 3.1 Pro Preview 94.3% $0.204
2 GPT-5.6 Sol Pro 93.8% $0.445
3 GPT-5.5 93.3% $0.303
4 Gemini 3.5 Flash 93.1% $0.137
5 Gemini 3.6 Flash 92.4% $0.090
6 Gemini 3.7 Flash 92.3% $0.015
7 GPT-5.6 Sol 91.4% $0.104
8 Kimi K3 91.3% $0.134
9 GPT-5.6 Luna Pro 90.7% $0.047
10 MiniMax M3 90.5% $0.028
11 GPT-5.4 90.4% $0.153
12 Nova Micro 1.0 89.7% $0.206
13 GPT-5.6 Terra 89.6% $0.021
14 Claude Opus 4.7 88.7% $0.225
15 Claude Opus 4.8 88.6% $0.189

Aucun modèle ne gagne tous les benchmarks.

Le leader change selon la tâche : un modèle domine le raisonnement, un autre le code, un troisième la recherche agentique. C'est exactement la raison d'être de MultipleChat — mettez les leaders côte à côte, laissez-les rédiger, se contester et se vérifier, et gardez la meilleure réponse.

Qualité, coût et vitesse ensemble

Un score de benchmark sans étiquette de prix, c'est du marketing. Chaque leaderboard ici associe la qualité au coût par tâche ou par million de tokens.

En direct et ouvert

Actualisé en continu et téléchargeable en JSON. Notre étude comparative trimestrielle est disponible sur le MultipleChat AI Benchmark.

Attribution

Source: OpenRouter (openrouter.ai/rankings) incl. les indices Artificial Analysis, as of 2026-08-23T21:05:22Z. Sous licence CC BY 4.0.