🛡️
Session Flagged

Your session has been flagged for unusual activity.

You can try our app by searching for MultipleChat AI on Google and clicking the multiplechat.ai link to try it free.
簡単な確認

続行するには、人間であることをご確認ください。


フロンティアモデルを、絶え間なくベンチマーク。

主要AIモデルの品質・コスト・速度 — ライブサイクルで更新 · 最終更新 2026-08-23.

知能・コーディング・エージェント指数

Artificial Analysisの総合指数 · 100万トークンあたり価格(入力/出力)

# モデル 知能 コーディング エージェント $ / 1M 入力 $ / 1M 出力
1 Claude Opus 5 (Adaptive Reasoning, Max Effort) 63.1 78 59.2 $5.50 $27.50
2 Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback) 62.1 76.5 56.6 $11.00 $55.00
3 GPT-5.6 Sol (max) 60.9 77.4 57.8 $5.50 $33.00
4 Grok 4.6 (high) 60.9 76.8 58.7 $2.00 $6.00
5 Kimi K3 (max) 59.7 76.2 54.3 $2.80 $14.00
6 GLM-5.3 (max) 59.5 74.8 59.1 $1.40 $4.40
7 Qwen3.8 Max 58.1 71.8 58.4 $2.00 $6.00
8 Qwen3.8 2.4T A95B 57.7 71.9 57.1 $2.00 $6.00
9 Claude Opus 4.8 (Adaptive Reasoning, Max Effort) 57.3 74.3 49.4 $5.50 $27.50
10 Muse Spark 1.2 (xhigh) 56.8 72.2 49.3 $1.25 $4.25
11 GPT-5.6 Terra (max) 56.6 76.7 50.2 $2.20 $13.20
12 GPT-5.5 (xhigh) 56.3 74.9 47.4 $5.50 $33.00
13 Gemini 3.7 Flash (high) 56 76.1 45.1 $0.190 $0.940
14 Grok 4.5 (high) 55.8 72.4 48.9 $2.00 $6.00
15 Claude Sonnet 5 (Adaptive Reasoning, Max Effort) 55.3 71.5 49.7 $2.20 $11.00
16 Claude Opus 4.7 (Adaptive Reasoning, Max Effort) 55 73.6 46.3 $5.50 $27.50
17 Muse Spark 1.1 (xhigh) 53.2 71.3 39.7 $1.25 $4.25
18 DeepSeek V4 Pro 0813 (Reasoning, Max Effort) 53.2 68.8 49.6 $1.32 $3.96
19 GPT-5.4 (xhigh) 53.1 71.1 44.2 $2.75 $16.50
20 GLM-5.2 (max) 52.6 68.8 45.7 $0.500 $3.15
21 GPT-5.6 Luna (max) 52.3 71.4 46.9 $0.220 $1.32
22 Gemini 3.5 Flash (high) 52 70.1 39.7 $1.65 $9.90
23 Qwen3.8 27B 52 68.1 50.9 $0.400 $3.00
24 DeepSeek V4 Flash 0731 (Reasoning, Max Effort) 51.8 69.1 48.4 $0.050 $0.100
25 Gemini 3.6 Flash (high) 51.6 69.2 40.5 $0.830 $4.12
26 Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort) 48.4 63 42.1 $3.30 $16.50
27 Gemini 3.1 Pro Preview 47.7 68.8 23 $2.00 $12.00
28 Qwen3.7 Max 46.7 66 30.9 $1.48 $4.42
29 MiniMax-M3 45.4 58.6 36.1 $0.280 $1.10
30 DeepSeek V4 Pro (Reasoning, Max Effort) 45.3 59.4 37.8 $0.410 $0.810

推論・エージェント・検索 — 最新モデルで再実行

GPQA Diamond

Graduate-level science reasoning

# モデル スコア $ / タスク
1 Gemini 3.1 Pro Preview 94.3% $0.204
2 GPT-5.6 Sol Pro 93.8% $0.445
3 GPT-5.5 93.3% $0.303
4 Gemini 3.5 Flash 93.1% $0.137
5 Gemini 3.6 Flash 92.4% $0.090
6 Gemini 3.7 Flash 92.3% $0.015
7 GPT-5.6 Sol 91.4% $0.104
8 Kimi K3 91.3% $0.134
9 GPT-5.6 Luna Pro 90.7% $0.047
10 MiniMax M3 90.5% $0.028
11 GPT-5.4 90.4% $0.153
12 Nova Micro 1.0 89.7% $0.206
13 GPT-5.6 Terra 89.6% $0.021
14 Claude Opus 4.7 88.7% $0.225
15 Claude Opus 4.8 88.6% $0.189

すべてのベンチマークで勝つモデルは存在しない。

タスクごとに首位は入れ替わります。推論はあるモデル、コーディングは別のモデル、エージェント検索はまた別のモデルがトップ。それこそがMultipleChatの存在理由です — トップモデルを並べ、起草・反論・検証をさせ、最良の答えだけを残しましょう。

品質・コスト・速度をまとめて

価格のないベンチマークスコアはマーケティングにすぎません。ここのリーダーボードはすべて、品質とタスクあたり・100万トークンあたりのコストを併記しています。

ライブ&オープン

常時更新され、次の形式でダウンロードできます: JSON. 当社の四半期比較調査はこちら: MultipleChat AI Benchmark

出典

Source: OpenRouter (openrouter.ai/rankings) (Artificial Analysis指数を含む), as of 2026-08-23T20:53:36Z. ライセンス: CC BY 4.0.