벤치마크 상세
AIME 2026
경시대회 수학: 수학, 논리 퍼즐, 단계적 계산, formal reasoning
공식 리더보드 보기
AIME 2026만 비교합니다. 대회 공개 뒤 출시된 모델은 원문과 동일하게 오염 가능성을 표시합니다. MATH·AIME 2025·다른 경시대회 점수를 합산하지 않습니다.
모든 공개 결과
모델 검색 · 점수순확인 2026. 09. 07.MathArena · AIME 2026% accuracy
32개 결과원문 ↗
| 순서 | 모델 / 실행 구성 | 점수 | 평가 조건·근거 |
|---|---|---|---|
| 1 | GPT-5.5 (xhigh)OpenAI | 100 | 평가 공개 후 출시 · 오염 가능성 |
| 2 | Claude-Opus-4.8 (max)Anthropic | 100 | 평가 공개 후 출시 · 오염 가능성 |
| 3 | GPT-5.4 (xhigh)OpenAI | 99.17 | 평가 공개 후 출시 · 오염 가능성 |
| 4 | GPT-5.2 (high)OpenAI | 98.33 | MathArena · AIME 2026 |
| 5 | Gemini 3.1 Pro PreviewGoogle | 98.33 | 평가 공개 후 출시 · 오염 가능성 |
| 6 | Step 3.5 FlashStepFun | 96.67 | MathArena · AIME 2026 |
| 7 | Gemini 3 FlashGoogle | 96.67 | MathArena · AIME 2026 |
| 8 | GLM 5Z.ai | 96.67 | 평가 공개 후 출시 · 오염 가능성 |
| 9 | DeepSeek-v4-Pro (Max)DeepSeek | 96.67 | 평가 공개 후 출시 · 오염 가능성 |
| 10 | Gemini 3.6 FlashGoogle | 96.67 | 평가 공개 후 출시 · 오염 가능성 |
| 11 | Kimi K3 (Think)Moonshot AI | 96.67 | 평가 공개 후 출시 · 오염 가능성 |
| 12 | Claude-Opus-4.6 (High)Anthropic | 96.67 | MathArena · AIME 2026 |
| 13 | DeepSeek-v4-Flash (Max)DeepSeek | 95.83 | 평가 공개 후 출시 · 오염 가능성 |
| 14 | Kimi K2.5 (Think)Moonshot AI | 95.83 | MathArena · AIME 2026 |
| 15 | GLM 5.1Z.ai | 95.83 | 평가 공개 후 출시 · 오염 가능성 |
| 16 | Kimi K2.6 (Think)Moonshot AI | 95.83 | 평가 공개 후 출시 · 오염 가능성 |
| 17 | Claude-Opus-4.7 (xhigh)Anthropic | 95.83 | 평가 공개 후 출시 · 오염 가능성 |
| 18 | Step 3.7 FlashStepFun | 95 | 평가 공개 후 출시 · 오염 가능성 |
| 19 | Gemini 3.5 FlashGoogle | 95 | 평가 공개 후 출시 · 오염 가능성 |
| 20 | Grok 4.1 Fast (Reasoning)xAI | 94.17 | MathArena · AIME 2026 |
| 21 | DeepSeek-v3.2 (Think)DeepSeek | 94.17 | MathArena · AIME 2026 |
| 22 | Qwen3.5-397b-a17bQwen | 94.17 | 평가 공개 후 출시 · 오염 가능성 |
| 23 | Qwen3.5-35B-A3BQwen | 93.33 | 평가 공개 후 출시 · 오염 가능성 |
| 24 | Qwen3.5-9BQwen | 92.5 | 평가 공개 후 출시 · 오염 가능성 |
| 25 | NVIDIA-Nemotron-3-SuperNVIDIA | 91.67 | 평가 공개 후 출시 · 오염 가능성 |
| 26 | Qwen3.5-27BQwen | 91.67 | 평가 공개 후 출시 · 오염 가능성 |
| 27 | Gemini 3 Pro (preview)Google | 91.67 | MathArena · AIME 2026 |
| 28 | GLM 5.2Z.ai | 90 | 평가 공개 후 출시 · 오염 가능성 |
| 29 | Qwen3.5-4BQwen | 89.67 | 평가 공개 후 출시 · 오염 가능성 |
| 30 | Qwen3-30B-A3B-2507-ThinkQwen | 88.33 | MathArena · AIME 2026 |
| 31 | QED-NanoLM-Provers | 82.5 | 평가 공개 후 출시 · 오염 가능성 |
| 32 | Qwen3-4B-2507-ThinkQwen | 82.5 | MathArena · AIME 2026 |
일치하는 모델이 없습니다. 검색어를 줄여 보세요.
공개된 숫자만 높은 순으로 표시합니다. 순서가 신뢰구간을 고려한 확정 순위는 아닙니다. AIME 2026만 비교합니다. 대회 공개 뒤 출시된 모델은 원문과 동일하게 오염 가능성을 표시합니다. MATH·AIME 2025·다른 경시대회 점수를 합산하지 않습니다.
읽는 법
전체 벤치마크MathArena에 공개된 AIME 2026 경시대회 문제의 정확도를 봅니다.
대회 공개 뒤 출시된 모델은 학습 데이터 오염 가능성을 표시합니다. 연도가 다른 AIME 점수와 직접 비교하지 않습니다.