النماذج الرائدة، تُقاس باستمرار.
جودة وتكلفة وسرعة أفضل نماذج الذكاء الاصطناعي — تُحدَّث بدورة مباشرة · آخر تحديث 2026-08-23.
مؤشرات الذكاء والبرمجة والوكلاء
مؤشرات مركّبة من Artificial Analysis · السعر لكل مليون رمز (إدخال / إخراج)
| # | النموذج | الذكاء | البرمجة | الوكلاء | $ / 1M إدخال | $ / 1M إخراج |
|---|---|---|---|---|---|---|
| 1 | Claude Opus 5 (Adaptive Reasoning, Max Effort) | 63.1 | 78 | 59.2 | $5.50 | $27.50 |
| 2 | Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback) | 62.1 | 76.5 | 56.6 | $11.00 | $55.00 |
| 3 | GPT-5.6 Sol (max) | 60.9 | 77.4 | 57.8 | $5.50 | $33.00 |
| 4 | Grok 4.6 (high) | 60.9 | 76.8 | 58.7 | $2.00 | $6.00 |
| 5 | Kimi K3 (max) | 59.7 | 76.2 | 54.3 | $2.80 | $14.00 |
| 6 | GLM-5.3 (max) | 59.5 | 74.8 | 59.1 | $1.40 | $4.40 |
| 7 | Qwen3.8 Max | 58.1 | 71.8 | 58.4 | $2.00 | $6.00 |
| 8 | Qwen3.8 2.4T A95B | 57.7 | 71.9 | 57.1 | $2.00 | $6.00 |
| 9 | Claude Opus 4.8 (Adaptive Reasoning, Max Effort) | 57.3 | 74.3 | 49.4 | $5.50 | $27.50 |
| 10 | Muse Spark 1.2 (xhigh) | 56.8 | 72.2 | 49.3 | $1.25 | $4.25 |
| 11 | GPT-5.6 Terra (max) | 56.6 | 76.7 | 50.2 | $2.20 | $13.20 |
| 12 | GPT-5.5 (xhigh) | 56.3 | 74.9 | 47.4 | $5.50 | $33.00 |
| 13 | Gemini 3.7 Flash (high) | 56 | 76.1 | 45.1 | $0.190 | $0.940 |
| 14 | Grok 4.5 (high) | 55.8 | 72.4 | 48.9 | $2.00 | $6.00 |
| 15 | Claude Sonnet 5 (Adaptive Reasoning, Max Effort) | 55.3 | 71.5 | 49.7 | $2.20 | $11.00 |
| 16 | Claude Opus 4.7 (Adaptive Reasoning, Max Effort) | 55 | 73.6 | 46.3 | $5.50 | $27.50 |
| 17 | Muse Spark 1.1 (xhigh) | 53.2 | 71.3 | 39.7 | $1.25 | $4.25 |
| 18 | DeepSeek V4 Pro 0813 (Reasoning, Max Effort) | 53.2 | 68.8 | 49.6 | $1.32 | $3.96 |
| 19 | GPT-5.4 (xhigh) | 53.1 | 71.1 | 44.2 | $2.75 | $16.50 |
| 20 | GLM-5.2 (max) | 52.6 | 68.8 | 45.7 | $0.500 | $3.15 |
| 21 | GPT-5.6 Luna (max) | 52.3 | 71.4 | 46.9 | $0.220 | $1.32 |
| 22 | Gemini 3.5 Flash (high) | 52 | 70.1 | 39.7 | $1.65 | $9.90 |
| 23 | Qwen3.8 27B | 52 | 68.1 | 50.9 | $0.400 | $3.00 |
| 24 | DeepSeek V4 Flash 0731 (Reasoning, Max Effort) | 51.8 | 69.1 | 48.4 | $0.050 | $0.100 |
| 25 | Gemini 3.6 Flash (high) | 51.6 | 69.2 | 40.5 | $0.830 | $4.12 |
| 26 | Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort) | 48.4 | 63 | 42.1 | $3.30 | $16.50 |
| 27 | Gemini 3.1 Pro Preview | 47.7 | 68.8 | 23 | $2.00 | $12.00 |
| 28 | Qwen3.7 Max | 46.7 | 66 | 30.9 | $1.48 | $4.42 |
| 29 | MiniMax-M3 | 45.4 | 58.6 | 36.1 | $0.280 | $1.10 |
| 30 | DeepSeek V4 Pro (Reasoning, Max Effort) | 45.3 | 59.4 | 37.8 | $0.410 | $0.810 |
الاستدلال والوكلاء والبحث — تُعاد على النماذج الحالية
GPQA Diamond
Graduate-level science reasoning
| # | النموذج | النتيجة | $ / مهمة |
|---|---|---|---|
| 1 | Gemini 3.1 Pro Preview | 94.3% | $0.204 |
| 2 | GPT-5.6 Sol Pro | 93.8% | $0.445 |
| 3 | GPT-5.5 | 93.3% | $0.303 |
| 4 | Gemini 3.5 Flash | 93.1% | $0.137 |
| 5 | Gemini 3.6 Flash | 92.4% | $0.090 |
| 6 | Gemini 3.7 Flash | 92.3% | $0.015 |
| 7 | GPT-5.6 Sol | 91.4% | $0.104 |
| 8 | Kimi K3 | 91.3% | $0.134 |
| 9 | GPT-5.6 Luna Pro | 90.7% | $0.047 |
| 10 | MiniMax M3 | 90.5% | $0.028 |
| 11 | GPT-5.4 | 90.4% | $0.153 |
| 12 | Nova Micro 1.0 | 89.7% | $0.206 |
| 13 | GPT-5.6 Terra | 89.6% | $0.021 |
| 14 | Claude Opus 4.7 | 88.7% | $0.225 |
| 15 | Claude Opus 4.8 | 88.6% | $0.189 |
لا يوجد نموذج واحد يفوز بكل المعايير.
يتغير المتصدر بحسب المهمة: نموذج يتفوق في الاستدلال، وآخر في البرمجة، وثالث في البحث الوكيلي. وهذا بالضبط سبب وجود MultipleChat — ضع المتصدرين جنبًا إلى جنب، ودعهم يكتبون ويتحدّون ويتحققون من بعضهم، واحتفظ بأفضل إجابة.
الجودة والتكلفة والسرعة معًا
نتيجة معيار بلا سعر هي مجرد تسويق. كل لوحة نتائج هنا تجمع الجودة مع التكلفة لكل مهمة أو لكل مليون رمز.
مباشر ومفتوح
يُحدَّث باستمرار ويمكن تنزيله بصيغة JSON. دراستنا المقارنة الفصلية متاحة على MultipleChat AI Benchmark.
الإسناد
Source: OpenRouter (openrouter.ai/rankings) بما في ذلك مؤشرات Artificial Analysis, as of 2026-08-23T20:53:36Z. مرخّصة بموجب CC BY 4.0.