벤치마크 상세

AIME 2026

경시대회 수학: 수학, 논리 퍼즐, 단계적 계산, formal reasoning

공식 리더보드 보기 AIME 2026만 비교합니다. 대회 공개 뒤 출시된 모델은 원문과 동일하게 오염 가능성을 표시합니다. MATH·AIME 2025·다른 경시대회 점수를 합산하지 않습니다.

모든 공개 결과

모델 검색 · 점수순
확인 2026. 09. 07.MathArena · AIME 2026% accuracy
32개 결과원문 ↗
순서모델 / 실행 구성점수평가 조건·근거
1GPT-5.5 (xhigh)OpenAI100평가 공개 후 출시 · 오염 가능성
2Claude-Opus-4.8 (max)Anthropic100평가 공개 후 출시 · 오염 가능성
3GPT-5.4 (xhigh)OpenAI99.17평가 공개 후 출시 · 오염 가능성
4GPT-5.2 (high)OpenAI98.33MathArena · AIME 2026
5Gemini 3.1 Pro PreviewGoogle98.33평가 공개 후 출시 · 오염 가능성
6Step 3.5 FlashStepFun96.67MathArena · AIME 2026
7Gemini 3 FlashGoogle96.67MathArena · AIME 2026
8GLM 5Z.ai96.67평가 공개 후 출시 · 오염 가능성
9DeepSeek-v4-Pro (Max)DeepSeek96.67평가 공개 후 출시 · 오염 가능성
10Gemini 3.6 FlashGoogle96.67평가 공개 후 출시 · 오염 가능성
11Kimi K3 (Think)Moonshot AI96.67평가 공개 후 출시 · 오염 가능성
12Claude-Opus-4.6 (High)Anthropic96.67MathArena · AIME 2026
13DeepSeek-v4-Flash (Max)DeepSeek95.83평가 공개 후 출시 · 오염 가능성
14Kimi K2.5 (Think)Moonshot AI95.83MathArena · AIME 2026
15GLM 5.1Z.ai95.83평가 공개 후 출시 · 오염 가능성
16Kimi K2.6 (Think)Moonshot AI95.83평가 공개 후 출시 · 오염 가능성
17Claude-Opus-4.7 (xhigh)Anthropic95.83평가 공개 후 출시 · 오염 가능성
18Step 3.7 FlashStepFun95평가 공개 후 출시 · 오염 가능성
19Gemini 3.5 FlashGoogle95평가 공개 후 출시 · 오염 가능성
20Grok 4.1 Fast (Reasoning)xAI94.17MathArena · AIME 2026
21DeepSeek-v3.2 (Think)DeepSeek94.17MathArena · AIME 2026
22Qwen3.5-397b-a17bQwen94.17평가 공개 후 출시 · 오염 가능성
23Qwen3.5-35B-A3BQwen93.33평가 공개 후 출시 · 오염 가능성
24Qwen3.5-9BQwen92.5평가 공개 후 출시 · 오염 가능성
25NVIDIA-Nemotron-3-SuperNVIDIA91.67평가 공개 후 출시 · 오염 가능성
26Qwen3.5-27BQwen91.67평가 공개 후 출시 · 오염 가능성
27Gemini 3 Pro (preview)Google91.67MathArena · AIME 2026
28GLM 5.2Z.ai90평가 공개 후 출시 · 오염 가능성
29Qwen3.5-4BQwen89.67평가 공개 후 출시 · 오염 가능성
30Qwen3-30B-A3B-2507-ThinkQwen88.33MathArena · AIME 2026
31QED-NanoLM-Provers82.5평가 공개 후 출시 · 오염 가능성
32Qwen3-4B-2507-ThinkQwen82.5MathArena · AIME 2026

공개된 숫자만 높은 순으로 표시합니다. 순서가 신뢰구간을 고려한 확정 순위는 아닙니다. AIME 2026만 비교합니다. 대회 공개 뒤 출시된 모델은 원문과 동일하게 오염 가능성을 표시합니다. MATH·AIME 2025·다른 경시대회 점수를 합산하지 않습니다.

MathArena에 공개된 AIME 2026 경시대회 문제의 정확도를 봅니다.

대회 공개 뒤 출시된 모델은 학습 데이터 오염 가능성을 표시합니다. 연도가 다른 AIME 점수와 직접 비교하지 않습니다.