🛡️
Session Flagged

Your session has been flagged for unusual activity.

You can try our app by searching for MultipleChat AI on Google and clicking the multiplechat.ai link to try it free.
간단한 확인

계속하려면 사람인지 확인해 주세요.


프런티어 모델을 끊임없이 벤치마크합니다.

최고 AI 모델의 품질·비용·속도 — 실시간 주기로 갱신 · 최근 업데이트 2026-08-23.

지능·코딩·에이전트 지수

Artificial Analysis 종합 지수 · 백만 토큰당 가격(입력/출력)

# 모델 지능 코딩 에이전트 $ / 1M 입력 $ / 1M 출력
1 Claude Opus 5 (Adaptive Reasoning, Max Effort) 63.1 78 59.2 $5.50 $27.50
2 Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback) 62.1 76.5 56.6 $11.00 $55.00
3 GPT-5.6 Sol (max) 60.9 77.4 57.8 $5.50 $33.00
4 Grok 4.6 (high) 60.9 76.8 58.7 $2.00 $6.00
5 Kimi K3 (max) 59.7 76.2 54.3 $2.80 $14.00
6 GLM-5.3 (max) 59.5 74.8 59.1 $1.40 $4.40
7 Qwen3.8 Max 58.1 71.8 58.4 $2.00 $6.00
8 Qwen3.8 2.4T A95B 57.7 71.9 57.1 $2.00 $6.00
9 Claude Opus 4.8 (Adaptive Reasoning, Max Effort) 57.3 74.3 49.4 $5.50 $27.50
10 Muse Spark 1.2 (xhigh) 56.8 72.2 49.3 $1.25 $4.25
11 GPT-5.6 Terra (max) 56.6 76.7 50.2 $2.20 $13.20
12 GPT-5.5 (xhigh) 56.3 74.9 47.4 $5.50 $33.00
13 Gemini 3.7 Flash (high) 56 76.1 45.1 $0.190 $0.940
14 Grok 4.5 (high) 55.8 72.4 48.9 $2.00 $6.00
15 Claude Sonnet 5 (Adaptive Reasoning, Max Effort) 55.3 71.5 49.7 $2.20 $11.00
16 Claude Opus 4.7 (Adaptive Reasoning, Max Effort) 55 73.6 46.3 $5.50 $27.50
17 Muse Spark 1.1 (xhigh) 53.2 71.3 39.7 $1.25 $4.25
18 DeepSeek V4 Pro 0813 (Reasoning, Max Effort) 53.2 68.8 49.6 $1.32 $3.96
19 GPT-5.4 (xhigh) 53.1 71.1 44.2 $2.75 $16.50
20 GLM-5.2 (max) 52.6 68.8 45.7 $0.500 $3.15
21 GPT-5.6 Luna (max) 52.3 71.4 46.9 $0.220 $1.32
22 Gemini 3.5 Flash (high) 52 70.1 39.7 $1.65 $9.90
23 Qwen3.8 27B 52 68.1 50.9 $0.400 $3.00
24 DeepSeek V4 Flash 0731 (Reasoning, Max Effort) 51.8 69.1 48.4 $0.050 $0.100
25 Gemini 3.6 Flash (high) 51.6 69.2 40.5 $0.830 $4.12
26 Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort) 48.4 63 42.1 $3.30 $16.50
27 Gemini 3.1 Pro Preview 47.7 68.8 23 $2.00 $12.00
28 Qwen3.7 Max 46.7 66 30.9 $1.48 $4.42
29 MiniMax-M3 45.4 58.6 36.1 $0.280 $1.10
30 DeepSeek V4 Pro (Reasoning, Max Effort) 45.3 59.4 37.8 $0.410 $0.810

추론·에이전트·검색 — 최신 모델로 재실행

GPQA Diamond

Graduate-level science reasoning

# 모델 점수 $ / 작업
1 Gemini 3.1 Pro Preview 94.3% $0.204
2 GPT-5.6 Sol Pro 93.8% $0.445
3 GPT-5.5 93.3% $0.303
4 Gemini 3.5 Flash 93.1% $0.137
5 Gemini 3.6 Flash 92.4% $0.090
6 Gemini 3.7 Flash 92.3% $0.015
7 GPT-5.6 Sol 91.4% $0.104
8 Kimi K3 91.3% $0.134
9 GPT-5.6 Luna Pro 90.7% $0.047
10 MiniMax M3 90.5% $0.028
11 GPT-5.4 90.4% $0.153
12 Nova Micro 1.0 89.7% $0.206
13 GPT-5.6 Terra 89.6% $0.021
14 Claude Opus 4.7 88.7% $0.225
15 Claude Opus 4.8 88.6% $0.189

모든 벤치마크에서 이기는 단일 모델은 없습니다.

작업마다 선두가 바뀝니다. 추론은 이 모델이, 코딩은 저 모델이, 에이전트 검색은 또 다른 모델이 최고입니다. MultipleChat이 존재하는 이유가 바로 이것입니다 — 선두 모델들을 나란히 두고 초안 작성, 반박, 검증을 시키고 최고의 답만 가져가세요.

품질·비용·속도를 함께

가격표 없는 벤치마크 점수는 마케팅일 뿐입니다. 이곳의 모든 리더보드는 품질과 작업당·백만 토큰당 비용을 함께 보여줍니다.

실시간 & 오픈

지속적으로 갱신되며 다음 형식으로 다운로드할 수 있습니다: JSON. 자체 분기별 비교 연구는 다음에서: MultipleChat AI Benchmark.

출처

Source: OpenRouter (openrouter.ai/rankings) (Artificial Analysis 지수 포함), as of 2026-08-23T20:53:36Z. 라이선스: CC BY 4.0.