🛡️
Session Flagged

Your session has been flagged for unusual activity.

You can try our app by searching for MultipleChat AI on Google and clicking the multiplechat.ai link to try it free.
تحقّق سريع

يرجى تأكيد أنك لست روبوتًا للمتابعة.


النماذج الرائدة، تُقاس باستمرار.

جودة وتكلفة وسرعة أفضل نماذج الذكاء الاصطناعي — تُحدَّث بدورة مباشرة · آخر تحديث 2026-08-23.

مؤشرات الذكاء والبرمجة والوكلاء

مؤشرات مركّبة من Artificial Analysis · السعر لكل مليون رمز (إدخال / إخراج)

# النموذج الذكاء البرمجة الوكلاء $ / 1M إدخال $ / 1M إخراج
1 Claude Opus 5 (Adaptive Reasoning, Max Effort) 63.1 78 59.2 $5.50 $27.50
2 Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback) 62.1 76.5 56.6 $11.00 $55.00
3 GPT-5.6 Sol (max) 60.9 77.4 57.8 $5.50 $33.00
4 Grok 4.6 (high) 60.9 76.8 58.7 $2.00 $6.00
5 Kimi K3 (max) 59.7 76.2 54.3 $2.80 $14.00
6 GLM-5.3 (max) 59.5 74.8 59.1 $1.40 $4.40
7 Qwen3.8 Max 58.1 71.8 58.4 $2.00 $6.00
8 Qwen3.8 2.4T A95B 57.7 71.9 57.1 $2.00 $6.00
9 Claude Opus 4.8 (Adaptive Reasoning, Max Effort) 57.3 74.3 49.4 $5.50 $27.50
10 Muse Spark 1.2 (xhigh) 56.8 72.2 49.3 $1.25 $4.25
11 GPT-5.6 Terra (max) 56.6 76.7 50.2 $2.20 $13.20
12 GPT-5.5 (xhigh) 56.3 74.9 47.4 $5.50 $33.00
13 Gemini 3.7 Flash (high) 56 76.1 45.1 $0.190 $0.940
14 Grok 4.5 (high) 55.8 72.4 48.9 $2.00 $6.00
15 Claude Sonnet 5 (Adaptive Reasoning, Max Effort) 55.3 71.5 49.7 $2.20 $11.00
16 Claude Opus 4.7 (Adaptive Reasoning, Max Effort) 55 73.6 46.3 $5.50 $27.50
17 Muse Spark 1.1 (xhigh) 53.2 71.3 39.7 $1.25 $4.25
18 DeepSeek V4 Pro 0813 (Reasoning, Max Effort) 53.2 68.8 49.6 $1.32 $3.96
19 GPT-5.4 (xhigh) 53.1 71.1 44.2 $2.75 $16.50
20 GLM-5.2 (max) 52.6 68.8 45.7 $0.500 $3.15
21 GPT-5.6 Luna (max) 52.3 71.4 46.9 $0.220 $1.32
22 Gemini 3.5 Flash (high) 52 70.1 39.7 $1.65 $9.90
23 Qwen3.8 27B 52 68.1 50.9 $0.400 $3.00
24 DeepSeek V4 Flash 0731 (Reasoning, Max Effort) 51.8 69.1 48.4 $0.050 $0.100
25 Gemini 3.6 Flash (high) 51.6 69.2 40.5 $0.830 $4.12
26 Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort) 48.4 63 42.1 $3.30 $16.50
27 Gemini 3.1 Pro Preview 47.7 68.8 23 $2.00 $12.00
28 Qwen3.7 Max 46.7 66 30.9 $1.48 $4.42
29 MiniMax-M3 45.4 58.6 36.1 $0.280 $1.10
30 DeepSeek V4 Pro (Reasoning, Max Effort) 45.3 59.4 37.8 $0.410 $0.810

الاستدلال والوكلاء والبحث — تُعاد على النماذج الحالية

GPQA Diamond

Graduate-level science reasoning

# النموذج النتيجة $ / مهمة
1 Gemini 3.1 Pro Preview 94.3% $0.204
2 GPT-5.6 Sol Pro 93.8% $0.445
3 GPT-5.5 93.3% $0.303
4 Gemini 3.5 Flash 93.1% $0.137
5 Gemini 3.6 Flash 92.4% $0.090
6 Gemini 3.7 Flash 92.3% $0.015
7 GPT-5.6 Sol 91.4% $0.104
8 Kimi K3 91.3% $0.134
9 GPT-5.6 Luna Pro 90.7% $0.047
10 MiniMax M3 90.5% $0.028
11 GPT-5.4 90.4% $0.153
12 Nova Micro 1.0 89.7% $0.206
13 GPT-5.6 Terra 89.6% $0.021
14 Claude Opus 4.7 88.7% $0.225
15 Claude Opus 4.8 88.6% $0.189

لا يوجد نموذج واحد يفوز بكل المعايير.

يتغير المتصدر بحسب المهمة: نموذج يتفوق في الاستدلال، وآخر في البرمجة، وثالث في البحث الوكيلي. وهذا بالضبط سبب وجود MultipleChat — ضع المتصدرين جنبًا إلى جنب، ودعهم يكتبون ويتحدّون ويتحققون من بعضهم، واحتفظ بأفضل إجابة.

الجودة والتكلفة والسرعة معًا

نتيجة معيار بلا سعر هي مجرد تسويق. كل لوحة نتائج هنا تجمع الجودة مع التكلفة لكل مهمة أو لكل مليون رمز.

مباشر ومفتوح

يُحدَّث باستمرار ويمكن تنزيله بصيغة JSON. دراستنا المقارنة الفصلية متاحة على MultipleChat AI Benchmark.

الإسناد

Source: OpenRouter (openrouter.ai/rankings) بما في ذلك مؤشرات Artificial Analysis, as of 2026-08-23T20:53:36Z. مرخّصة بموجب CC BY 4.0.