벤치마크 상세
MMMU-Pro
고난도 이미지 추론: 고난도 이미지 추론
공식 리더보드 보기
AA가 같은 방식으로 평가한 MMMU-Pro 결과입니다. 원래 MMMU validation/test 점수와 다른 표로 분리했습니다.
모든 공개 결과
모델 검색 · 점수순확인 2026. 09. 07.Artificial Analysis · MMMU-Pro% correct
258개 결과원문 ↗
| 순서 | 모델 / 실행 구성 | 점수 | 평가 조건·근거 |
|---|---|---|---|
| 1 | GPT-6 Astra (max)OpenAI | 86.88 | Artificial Analysis · MMMU-Pro |
| 2 | GPT-6 Astra (high)OpenAI | 86.42 | Artificial Analysis · MMMU-Pro |
| 3 | GPT-6 Astra (xhigh)OpenAI | 86.24 | Artificial Analysis · MMMU-Pro |
| 4 | Gemini 3.8 Flash (high)Google | 85.61 | Artificial Analysis · MMMU-Pro |
| 5 | Gemini 3.7 Flash (high)Google | 85.49 | Artificial Analysis · MMMU-Pro |
| 6 | GPT-6 Astra (medium)OpenAI | 85.09 | Artificial Analysis · MMMU-Pro |
| 7 | Gemini 3.7 Flash (low)Google | 84.86 | Artificial Analysis · MMMU-Pro |
| 8 | Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic | 84.74 | Artificial Analysis · MMMU-Pro |
| 9 | Gemini 3.7 Flash (medium)Google | 84.74 | Artificial Analysis · MMMU-Pro |
| 10 | GPT-6 Astra (low)OpenAI | 84.62 | Artificial Analysis · MMMU-Pro |
| 11 | Gemini 3.8 Flash (low)Google | 84.51 | Artificial Analysis · MMMU-Pro |
| 12 | Gemini 3.5 Flash (high)Google | 84.28 | Artificial Analysis · MMMU-Pro |
| 13 | Gemini 3.8 Flash (medium)Google | 84.22 | Artificial Analysis · MMMU-Pro |
| 14 | Claude Opus 5 (Adaptive Reasoning, Xhigh Effort)Anthropic | 83.99 | Artificial Analysis · MMMU-Pro |
| 15 | Gemini 3.5 Flash (medium)Google | 83.87 | Artificial Analysis · MMMU-Pro |
| 16 | GPT-5.6 Sol (max)OpenAI | 83.41 | Artificial Analysis · MMMU-Pro |
| 17 | Gemini 3.6 Flash (high)Google | 83.24 | Artificial Analysis · MMMU-Pro |
| 18 | GPT-5.6 Sol (xhigh)OpenAI | 82.66 | Artificial Analysis · MMMU-Pro |
| 19 | Claude Opus 5 (Adaptive Reasoning, High Effort)Anthropic | 82.43 | Artificial Analysis · MMMU-Pro |
| 20 | Gemini 3.1 Pro PreviewGoogle | 82.43 | Artificial Analysis · MMMU-Pro |
| 21 | Qwen3.8 MaxAlibaba | 82.31 | Artificial Analysis · MMMU-Pro |
| 22 | GPT-6 Astra (Non-reasoning)OpenAI | 82.02 | Artificial Analysis · MMMU-Pro |
| 23 | Muse Spark 1.3 (xhigh)Meta | 82.02 | Artificial Analysis · MMMU-Pro |
| 24 | GPT-5.6 Sol (high)OpenAI | 81.85 | Artificial Analysis · MMMU-Pro |
| 25 | Claude Opus 5 (Adaptive Reasoning, Medium Effort)Anthropic | 81.62 | Artificial Analysis · MMMU-Pro |
| 26 | GPT-5.6 Sol (medium)OpenAI | 81.39 | Artificial Analysis · MMMU-Pro |
| 27 | GPT-5.5 (medium)OpenAI | 81.16 | Artificial Analysis · MMMU-Pro |
| 28 | GPT-5.5 (high)OpenAI | 81.1 | Artificial Analysis · MMMU-Pro |
| 29 | GPT-5.6 Sol (low)OpenAI | 80.98 | Artificial Analysis · MMMU-Pro |
| 30 | GPT-5.6 Terra (max)OpenAI | 80.69 | Artificial Analysis · MMMU-Pro |
| 31 | Muse SparkMeta | 80.52 | Artificial Analysis · MMMU-Pro |
| 32 | Kimi K3 (max)Kimi | 80.52 | Artificial Analysis · MMMU-Pro |
| 33 | Qwen3.7 PlusAlibaba | 80.46 | Artificial Analysis · MMMU-Pro |
| 34 | Grok 4.5 (high)SpaceXAI | 80.4 | Artificial Analysis · MMMU-Pro |
| 35 | Gemini 3 Pro Preview (high)Google | 80.17 | Artificial Analysis · MMMU-Pro |
| 36 | Gemini 3.5 Flash (minimal)Google | 80.12 | Artificial Analysis · MMMU-Pro |
| 37 | Gemini 3 Flash Preview (Reasoning)Google | 79.94 | Artificial Analysis · MMMU-Pro |
| 38 | GPT-5.5 (xhigh)OpenAI | 79.88 | Artificial Analysis · MMMU-Pro |
| 39 | Claude Opus 5 (Adaptive Reasoning, Low Effort)Anthropic | 79.83 | Artificial Analysis · MMMU-Pro |
| 40 | Qwen3.8-Flash-NextAlibaba | 79.77 | Artificial Analysis · MMMU-Pro |
| 41 | GPT-5.6 Terra (xhigh)OpenAI | 79.48 | Artificial Analysis · MMMU-Pro |
| 42 | Kimi K2.6Kimi | 79.36 | Artificial Analysis · MMMU-Pro |
| 43 | Apodex 1.1Apodex | 79.19 | Artificial Analysis · MMMU-Pro |
| 44 | GPT-5.6 Terra (high)OpenAI | 79.08 | Artificial Analysis · MMMU-Pro |
| 45 | Gemini 3.5 Flash-LiteGoogle | 79.02 | Artificial Analysis · MMMU-Pro |
| 46 | GPT-5.5 (low)OpenAI | 79.02 | Artificial Analysis · MMMU-Pro |
| 47 | Claude Opus 4.7 (Adaptive Reasoning, Max Effort)Anthropic | 78.84 | Artificial Analysis · MMMU-Pro |
| 48 | MiniMax-M3MiniMax | 78.55 | Artificial Analysis · MMMU-Pro |
| 49 | GPT-5.6 Luna (max)OpenAI | 78.55 | Artificial Analysis · MMMU-Pro |
| 50 | Gemini 3 Flash Preview (Non-reasoning)Google | 78.55 | Artificial Analysis · MMMU-Pro |
| 51 | GPT-5.6 Luna (xhigh)OpenAI | 78.55 | Artificial Analysis · MMMU-Pro |
| 52 | Kimi K3 (low)Kimi | 78.5 | Artificial Analysis · MMMU-Pro |
| 53 | GPT-5.3 Codex (xhigh)OpenAI | 78.5 | Artificial Analysis · MMMU-Pro |
| 54 | GPT-5.4 (xhigh)OpenAI | 78.44 | Artificial Analysis · MMMU-Pro |
| 55 | Grok 4.3 (high)SpaceXAI | 78.09 | Artificial Analysis · MMMU-Pro |
| 56 | GPT-5.4 (low)OpenAI | 77.98 | Artificial Analysis · MMMU-Pro |
| 57 | Qwen3.6 PlusAlibaba | 77.98 | Artificial Analysis · MMMU-Pro |
| 58 | GPT-5.6 Luna (high)OpenAI | 77.57 | Artificial Analysis · MMMU-Pro |
| 59 | Qwen3.5 397B A17B (Reasoning)Alibaba | 77.28 | Artificial Analysis · MMMU-Pro |
| 60 | Claude Sonnet 5 (Adaptive Reasoning, Max Effort)Anthropic | 77.28 | Artificial Analysis · MMMU-Pro |
| 61 | GPT-5.6 Terra (medium)OpenAI | 76.76 | Artificial Analysis · MMMU-Pro |
| 62 | Grok Build 0.1 0616SpaceXAI | 76.53 | Artificial Analysis · MMMU-Pro |
| 63 | Claude Opus 4.7 (Non-reasoning, High Effort)Anthropic | 76.36 | Artificial Analysis · MMMU-Pro |
| 64 | GPT-5.2 Codex (xhigh)OpenAI | 76.3 | Artificial Analysis · MMMU-Pro |
| 65 | Qwen3.8 27B (xhigh)Alibaba | 76.3 | Artificial Analysis · MMMU-Pro |
| 66 | GPT-5.6 Terra (low)OpenAI | 76.13 | Artificial Analysis · MMMU-Pro |
| 67 | GPT-5.6 Luna (medium)OpenAI | 75.84 | Artificial Analysis · MMMU-Pro |
| 68 | Grok 4.3 (medium)SpaceXAI | 75.84 | Artificial Analysis · MMMU-Pro |
| 69 | Gemini 3.1 Flash-LiteGoogle | 75.55 | Artificial Analysis · MMMU-Pro |
| 70 | GPT-5.1 (high)OpenAI | 75.49 | Artificial Analysis · MMMU-Pro |
| 71 | MiMo-V2.5Xiaomi | 75.43 | Artificial Analysis · MMMU-Pro |
| 72 | Claude Opus 4.6 (Adaptive Reasoning, Max Effort)Anthropic | 75.43 | Artificial Analysis · MMMU-Pro |
| 73 | Agnes 2.5 Pro BetaSapiens AI | 75.43 | Artificial Analysis · MMMU-Pro |
| 74 | Kimi K2.5 (Reasoning)Kimi | 75.38 | Artificial Analysis · MMMU-Pro |
| 75 | Step 3.7 FlashStepFun | 75.32 | Artificial Analysis · MMMU-Pro |
| 76 | Qwen3.5 27B (Reasoning)Alibaba | 75.03 | Artificial Analysis · MMMU-Pro |
| 77 | Qwen3.6 35B A3B (Reasoning)Alibaba | 75.03 | Artificial Analysis · MMMU-Pro |
| 78 | Qwen3.5 122B A10B (Reasoning)Alibaba | 74.97 | Artificial Analysis · MMMU-Pro |
| 79 | Gemini 2.5 ProGoogle | 74.91 | Artificial Analysis · MMMU-Pro |
| 80 | DeepSeek V4 Flash Vision (Reasoning, Max Effort)DeepSeek | 74.8 | Artificial Analysis · MMMU-Pro |
| 81 | Qwen3.6 27B (Reasoning)Alibaba | 74.62 | Artificial Analysis · MMMU-Pro |
| 82 | GPT-5.2 (medium)OpenAI | 74.57 | Artificial Analysis · MMMU-Pro |
| 83 | Grok 4.20 0309 v2 (Reasoning)SpaceXAI | 74.57 | Artificial Analysis · MMMU-Pro |
| 84 | Muse Glimmer (high)Meta | 74.34 | Artificial Analysis · MMMU-Pro |
| 85 | GPT-5 (medium)OpenAI | 74.34 | Artificial Analysis · MMMU-Pro |
| 86 | GPT-5 (high)OpenAI | 74.22 | Artificial Analysis · MMMU-Pro |
| 87 | Qwen3.8 27B (medium)Alibaba | 74.16 | Artificial Analysis · MMMU-Pro |
| 88 | Claude Opus 4.5 (Reasoning)Anthropic | 74.05 | Artificial Analysis · MMMU-Pro |
| 89 | Inkling SmallThinking Machines | 74.05 | Artificial Analysis · MMMU-Pro |
| 90 | GPT-5.6 Luna (low)OpenAI | 73.99 | Artificial Analysis · MMMU-Pro |
| 91 | MiMo-V2-Omni-0327Xiaomi | 73.93 | Artificial Analysis · MMMU-Pro |
| 92 | GPT-5 Codex (high)OpenAI | 73.82 | Artificial Analysis · MMMU-Pro |
| 93 | Qwen3.8 27B (low)Alibaba | 73.76 | Artificial Analysis · MMMU-Pro |
| 94 | GPT-5 (low)OpenAI | 73.76 | Artificial Analysis · MMMU-Pro |
| 95 | Inkling (xhigh)Thinking Machines | 73.47 | Artificial Analysis · MMMU-Pro |
| 96 | Gemma 4 31B (Reasoning)Google | 73.41 | Artificial Analysis · MMMU-Pro |
| 97 | GPT-5.4 mini (xhigh)OpenAI | 73.29 | Artificial Analysis · MMMU-Pro |
| 98 | Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort)Anthropic | 73.29 | Artificial Analysis · MMMU-Pro |
| 99 | Grok 4.20 0309 (Reasoning)SpaceXAI | 73.18 | Artificial Analysis · MMMU-Pro |
| 100 | Gemini 2.5 Flash Preview (Sep '25) (Reasoning)Google | 73.12 | Artificial Analysis · MMMU-Pro |
| 101 | Kimi K2.5 (Non-reasoning)Kimi | 73.06 | Artificial Analysis · MMMU-Pro |
| 102 | GLM 5V Turbo (Reasoning)Z AI | 72.77 | Artificial Analysis · MMMU-Pro |
| 103 | Grok 4.3 (low)SpaceXAI | 72.77 | Artificial Analysis · MMMU-Pro |
| 104 | Qwen3.5 35B A3B (Reasoning)Alibaba | 72.66 | Artificial Analysis · MMMU-Pro |
| 105 | Claude Opus 4.6 (Non-reasoning, High Effort)Anthropic | 72.54 | Artificial Analysis · MMMU-Pro |
| 106 | GPT-5.1 Codex (high)OpenAI | 72.49 | Artificial Analysis · MMMU-Pro |
| 107 | GPT-5.6 Sol (Non-reasoning)OpenAI | 71.91 | Artificial Analysis · MMMU-Pro |
| 108 | Claude Sonnet 5 (Non-reasoning, High Effort)Anthropic | 71.91 | Artificial Analysis · MMMU-Pro |
| 109 | Qwen3.6 27B (Non-reasoning)Alibaba | 71.73 | Artificial Analysis · MMMU-Pro |
| 110 | GPT-5.5 (Non-reasoning)OpenAI | 71.39 | Artificial Analysis · MMMU-Pro |
| 111 | Claude Opus 4.5 (Non-reasoning)Anthropic | 71.21 | Artificial Analysis · MMMU-Pro |
| 112 | GPT-5.4 mini (medium)OpenAI | 71.16 | Artificial Analysis · MMMU-Pro |
| 113 | Qwen3.6 35B A3B (Non-reasoning)Alibaba | 71.04 | Artificial Analysis · MMMU-Pro |
| 114 | Claude Sonnet 4.6 (Non-reasoning, High Effort)Anthropic | 70.58 | Artificial Analysis · MMMU-Pro |
| 115 | GPT-5.4 (Non-reasoning)OpenAI | 70.58 | Artificial Analysis · MMMU-Pro |
| 116 | Qwen3.5 Omni PlusAlibaba | 70.52 | Artificial Analysis · MMMU-Pro |
| 117 | Gemma 4 31B (Non-reasoning)Google | 70.35 | Artificial Analysis · MMMU-Pro |
| 118 | Qwen3.5 122B A10B (Non-reasoning)Alibaba | 70.29 | Artificial Analysis · MMMU-Pro |
| 119 | Gemini 2.5 Flash Preview (Sep '25) (Non-reasoning)Google | 70.23 | Artificial Analysis · MMMU-Pro |
| 120 | o3OpenAI | 70.06 | Artificial Analysis · MMMU-Pro |
| 121 | GPT-5 mini (high)OpenAI | 70.06 | Artificial Analysis · MMMU-Pro |
| 122 | Qwen3.5 27B (Non-reasoning)Alibaba | 70 | Artificial Analysis · MMMU-Pro |
| 123 | Qwen3.8 27B (Non-reasoning)Alibaba | 69.94 | Artificial Analysis · MMMU-Pro |
| 124 | MiMo-V2-OmniXiaomi | 69.88 | Artificial Analysis · MMMU-Pro |
| 125 | Gemma 4 12B (Reasoning)Google | 69.65 | Artificial Analysis · MMMU-Pro |
| 126 | Qwen3.5 9B (Reasoning)Alibaba | 69.25 | Artificial Analysis · MMMU-Pro |
| 127 | Gemma 4 26B A4B (Reasoning)Google | 69.25 | Artificial Analysis · MMMU-Pro |
| 128 | o4-mini (high)OpenAI | 69.25 | Artificial Analysis · MMMU-Pro |
| 129 | Qwen3.5 35B A3B (Non-reasoning)Alibaba | 69.19 | Artificial Analysis · MMMU-Pro |
| 130 | Claude Sonnet 4.6 (Non-reasoning, Low Effort)Anthropic | 69.19 | Artificial Analysis · MMMU-Pro |
| 131 | Gemini 2.5 Flash (Reasoning)Google | 69.08 | Artificial Analysis · MMMU-Pro |
| 132 | GPT-5.1 Codex mini (high)OpenAI | 69.02 | Artificial Analysis · MMMU-Pro |
| 133 | Grok 4SpaceXAI | 68.84 | Artificial Analysis · MMMU-Pro |
| 134 | GPT-5 mini (medium)OpenAI | 68.84 | Artificial Analysis · MMMU-Pro |
| 135 | Claude 4.5 Sonnet (Reasoning)Anthropic | 68.73 | Artificial Analysis · MMMU-Pro |
| 136 | Qwen3 VL 235B A22B (Reasoning)Alibaba | 68.73 | Artificial Analysis · MMMU-Pro |
| 137 | Doubao Seed CodeByteDance Seed | 68.09 | Artificial Analysis · MMMU-Pro |
| 138 | Claude 4.1 Opus (Reasoning)Anthropic | 67.92 | Artificial Analysis · MMMU-Pro |
| 139 | Qwen3 VL 235B A22B InstructAlibaba | 67.57 | Artificial Analysis · MMMU-Pro |
| 140 | EXAONE 4.5 33BLG AI Research | 67.34 | Artificial Analysis · MMMU-Pro |
| 141 | Qwen3.5 9B (Non-reasoning)Alibaba | 66.76 | Artificial Analysis · MMMU-Pro |
| 142 | Gemma 4 26B A4B (Non-reasoning)Google | 66.71 | Artificial Analysis · MMMU-Pro |
| 143 | GPT-5.6 Terra (Non-reasoning)OpenAI | 66.71 | Artificial Analysis · MMMU-Pro |
| 144 | DiffusionGemma 26B A4BGoogle | 66.53 | Artificial Analysis · MMMU-Pro |
| 145 | GPT-5.2 (Non-reasoning)OpenAI | 65.84 | Artificial Analysis · MMMU-Pro |
| 146 | Gemini 2.5 Flash (Non-reasoning)Google | 65.49 | Artificial Analysis · MMMU-Pro |
| 147 | Qwen3.5 4B (Reasoning)Alibaba | 65.38 | Artificial Analysis · MMMU-Pro |
| 148 | GPT-5.4 nano (xhigh)OpenAI | 65.38 | Artificial Analysis · MMMU-Pro |
| 149 | Claude 4.5 Sonnet (Non-reasoning)Anthropic | 65.2 | Artificial Analysis · MMMU-Pro |
| 150 | Gemini 2.5 Flash-Lite Preview (Sep '25) (Reasoning)Google | 64.97 | Artificial Analysis · MMMU-Pro |
| 151 | Grok 4.20 0309 v2 (Non-reasoning)SpaceXAI | 64.91 | Artificial Analysis · MMMU-Pro |
| 152 | Mistral Medium 3.5Mistral | 64.86 | Artificial Analysis · MMMU-Pro |
| 153 | Grok 4.3 (Non-reasoning)SpaceXAI | 64.8 | Artificial Analysis · MMMU-Pro |
| 154 | Qwen3.5 Omni FlashAlibaba | 64.74 | Artificial Analysis · MMMU-Pro |
| 155 | ERNIE 5.0 Thinking PreviewBaidu | 64.57 | Artificial Analysis · MMMU-Pro |
| 156 | Nova 2.0 Pro Preview (medium)Amazon | 64.51 | Artificial Analysis · MMMU-Pro |
| 157 | Qwen3 VL 32B InstructAlibaba | 64.28 | Artificial Analysis · MMMU-Pro |
| 158 | JT-4.1 Flash 236B A21BChina Mobile | 64.1 | Artificial Analysis · MMMU-Pro |
| 159 | Grok 4.20 0309 (Non-reasoning)SpaceXAI | 64.05 | Artificial Analysis · MMMU-Pro |
| 160 | Step3 VL 10BStepFun | 63.99 | Artificial Analysis · MMMU-Pro |
| 161 | Nova 2.0 Lite (high)Amazon | 63.76 | Artificial Analysis · MMMU-Pro |
| 162 | Gemini 2.5 Flash-Lite Preview (Sep '25) (Non-reasoning)Google | 63.41 | Artificial Analysis · MMMU-Pro |
| 163 | Qwen3 VL 32B (Reasoning)Alibaba | 63.41 | Artificial Analysis · MMMU-Pro |
| 164 | Grok 4.1 Fast (Reasoning)SpaceXAI | 63.29 | Artificial Analysis · MMMU-Pro |
| 165 | Command A+Cohere | 63.24 | Artificial Analysis · MMMU-Pro |
| 166 | Nova 2.0 Pro Preview (low)Amazon | 62.72 | Artificial Analysis · MMMU-Pro |
| 167 | Nova 2.0 Lite (medium)Amazon | 62.54 | Artificial Analysis · MMMU-Pro |
| 168 | Claude 4 Sonnet (Non-reasoning)Anthropic | 62.37 | Artificial Analysis · MMMU-Pro |
| 169 | GPT-5.1 (Non-reasoning)OpenAI | 62.37 | Artificial Analysis · MMMU-Pro |
| 170 | Qwen3 VL 30B A3B InstructAlibaba | 62.14 | Artificial Analysis · MMMU-Pro |
| 171 | Llama 4 MaverickMeta | 62.14 | Artificial Analysis · MMMU-Pro |
| 172 | Qwen3.5 4B (Non-reasoning)Alibaba | 62.08 | Artificial Analysis · MMMU-Pro |
| 173 | GPT-5 (minimal)OpenAI | 62.08 | Artificial Analysis · MMMU-Pro |
| 174 | Gemma 4 12B (Non-reasoning)Google | 61.97 | Artificial Analysis · MMMU-Pro |
| 175 | Gemini 2.5 Flash Preview (Non-reasoning)Google | 61.97 | Artificial Analysis · MMMU-Pro |
| 176 | Nova 2.0 Omni (medium)Amazon | 61.91 | Artificial Analysis · MMMU-Pro |
| 177 | Qwen3 VL 30B A3B (Reasoning)Alibaba | 61.85 | Artificial Analysis · MMMU-Pro |
| 178 | Grok 4 Fast (Reasoning)SpaceXAI | 61.79 | Artificial Analysis · MMMU-Pro |
| 179 | Claude 4 Sonnet (Reasoning)Anthropic | 61.79 | Artificial Analysis · MMMU-Pro |
| 180 | GPT-4.1OpenAI | 61.21 | Artificial Analysis · MMMU-Pro |
| 181 | GPT-5 nano (high)OpenAI | 60.98 | Artificial Analysis · MMMU-Pro |
| 182 | GPT-5.4 mini (Non-Reasoning)OpenAI | 60.46 | Artificial Analysis · MMMU-Pro |
| 183 | GPT-5.6 Luna (Non-reasoning)OpenAI | 60.35 | Artificial Analysis · MMMU-Pro |
| 184 | Qwen3 Omni 30B A3B (Reasoning)Alibaba | 60.23 | Artificial Analysis · MMMU-Pro |
| 185 | Claude 3.7 Sonnet (Non-reasoning)Anthropic | 60.06 | Artificial Analysis · MMMU-Pro |
| 186 | Nova 2.0 Omni (low)Amazon | 59.83 | Artificial Analysis · MMMU-Pro |
| 187 | Magistral Medium 1.2Mistral | 59.65 | Artificial Analysis · MMMU-Pro |
| 188 | GPT-5.4 nano (medium)OpenAI | 59.54 | Artificial Analysis · MMMU-Pro |
| 189 | GPT-4.1 miniOpenAI | 58.73 | Artificial Analysis · MMMU-Pro |
| 190 | Claude 4.5 Haiku (Reasoning)Anthropic | 58.55 | Artificial Analysis · MMMU-Pro |
| 191 | GPT-5 mini (minimal)OpenAI | 58.38 | Artificial Analysis · MMMU-Pro |
| 192 | GPT-5 nano (medium)OpenAI | 58.21 | Artificial Analysis · MMMU-Pro |
| 193 | Gemini 2.5 Flash-Lite (Reasoning)Google | 58.21 | Artificial Analysis · MMMU-Pro |
| 194 | Nova 2.0 Lite (low)Amazon | 57.98 | Artificial Analysis · MMMU-Pro |
| 195 | Apriel-v1.5-15B-ThinkerServiceNow | 57.05 | Artificial Analysis · MMMU-Pro |
| 196 | Mistral Small 4 (Reasoning)Mistral | 56.82 | Artificial Analysis · MMMU-Pro |
| 197 | Qwen3 VL 8B (Reasoning)Alibaba | 56.65 | Artificial Analysis · MMMU-Pro |
| 198 | GPT-4o (Aug '24)OpenAI | 56.3 | Artificial Analysis · MMMU-Pro |
| 199 | Mistral Large 3Mistral | 55.66 | Artificial Analysis · MMMU-Pro |
| 200 | Qwen3 Omni 30B A3B InstructAlibaba | 55.49 | Artificial Analysis · MMMU-Pro |
| 201 | Magistral Small 1.2Mistral | 55.49 | Artificial Analysis · MMMU-Pro |
| 202 | Claude 4.5 Haiku (Non-reasoning)Anthropic | 55.14 | Artificial Analysis · MMMU-Pro |
| 203 | Gemini 1.5 Pro (Sep '24)Google | 55.03 | Artificial Analysis · MMMU-Pro |
| 204 | Mistral Medium 3.1Mistral | 54.16 | Artificial Analysis · MMMU-Pro |
| 205 | Gemini 2.5 Flash-Lite (Non-reasoning)Google | 53.99 | Artificial Analysis · MMMU-Pro |
| 206 | Nemotron 3 Nano Omni 30B A3B ReasoningNVIDIA | 53.18 | Artificial Analysis · MMMU-Pro |
| 207 | Mistral Medium 3Mistral | 53.01 | Artificial Analysis · MMMU-Pro |
| 208 | Llama 4 ScoutMeta | 52.95 | Artificial Analysis · MMMU-Pro |
| 209 | NVIDIA Nemotron Nano 12B v2 VL (Reasoning)NVIDIA | 52.89 | Artificial Analysis · MMMU-Pro |
| 210 | Qwen3.5 397B A17B (Non-reasoning)Alibaba | 52.66 | Artificial Analysis · MMMU-Pro |
| 211 | Qwen3 VL 4B (Reasoning)Alibaba | 52.02 | Artificial Analysis · MMMU-Pro |
| 212 | Gemma 4 E4B (Reasoning)Google | 51.39 | Artificial Analysis · MMMU-Pro |
| 213 | Gemma 4 E4B (Non-reasoning)Google | 51.21 | Artificial Analysis · MMMU-Pro |
| 214 | Pixtral LargeMistral | 50.58 | Artificial Analysis · MMMU-Pro |
| 215 | GLM-4.5V (Reasoning)Z AI | 50.46 | Artificial Analysis · MMMU-Pro |
| 216 | Nova 2.0 Omni (Non-reasoning)Amazon | 49.88 | Artificial Analysis · MMMU-Pro |
| 217 | Ministral 3 14BMistral | 49.83 | Artificial Analysis · MMMU-Pro |
| 218 | Nova 2.0 Lite (Non-reasoning)Amazon | 49.02 | Artificial Analysis · MMMU-Pro |
| 219 | GLM-4.6V (Reasoning)Z AI | 48.55 | Artificial Analysis · MMMU-Pro |
| 220 | Grok 4.1 Fast (Non-reasoning)SpaceXAI | 48.44 | Artificial Analysis · MMMU-Pro |
| 221 | Gemini 1.5 Flash (Sep '24)Google | 48.38 | Artificial Analysis · MMMU-Pro |
| 222 | Grok 4 Fast (Non-reasoning)SpaceXAI | 48.09 | Artificial Analysis · MMMU-Pro |
| 223 | Gemma 3 27B InstructGoogle | 48.03 | Artificial Analysis · MMMU-Pro |
| 224 | Mistral Small 3.2Mistral | 47.98 | Artificial Analysis · MMMU-Pro |
| 225 | Qwen3 VL 8B InstructAlibaba | 47.34 | Artificial Analysis · MMMU-Pro |
| 226 | Mistral Small 4 (Non-reasoning)Mistral | 46.47 | Artificial Analysis · MMMU-Pro |
| 227 | Ministral 3 8BMistral | 45.95 | Artificial Analysis · MMMU-Pro |
| 228 | Claude 3.5 HaikuAnthropic | 45.61 | Artificial Analysis · MMMU-Pro |
| 229 | Devstral Small 2Mistral | 44.62 | Artificial Analysis · MMMU-Pro |
| 230 | Gemma 4 E2B (Reasoning)Google | 44.57 | Artificial Analysis · MMMU-Pro |
| 231 | NVIDIA Nemotron Nano 12B v2 VL (Non-reasoning)NVIDIA | 44.51 | Artificial Analysis · MMMU-Pro |
| 232 | Nova ProAmazon | 44.34 | Artificial Analysis · MMMU-Pro |
| 233 | Qwen3 VL 4B InstructAlibaba | 43.87 | Artificial Analysis · MMMU-Pro |
| 234 | GPT-5.4 nano (Non-Reasoning)OpenAI | 43.76 | Artificial Analysis · MMMU-Pro |
| 235 | Qwen3.5 2B (Reasoning)Alibaba | 43.01 | Artificial Analysis · MMMU-Pro |
| 236 | GLM-4.5V (Non-reasoning)Z AI | 42.77 | Artificial Analysis · MMMU-Pro |
| 237 | Qwen3.5 2B (Non-reasoning)Alibaba | 42.66 | Artificial Analysis · MMMU-Pro |
| 238 | GLM-4.6V (Non-reasoning)Z AI | 42.2 | Artificial Analysis · MMMU-Pro |
| 239 | Gemma 4 E2B (Non-reasoning)Google | 41.79 | Artificial Analysis · MMMU-Pro |
| 240 | GPT-4o miniOpenAI | 41.5 | Artificial Analysis · MMMU-Pro |
| 241 | GPT-4.1 nanoOpenAI | 40.12 | Artificial Analysis · MMMU-Pro |
| 242 | Llama 3.2 Instruct 90B (Vision)Meta | 39.48 | Artificial Analysis · MMMU-Pro |
| 243 | Ministral 3 3BMistral | 38.09 | Artificial Analysis · MMMU-Pro |
| 244 | MiniCPM-V 4.6 1.3BOpenBMB | 37.92 | Artificial Analysis · MMMU-Pro |
| 245 | Nova LiteAmazon | 37.8 | Artificial Analysis · MMMU-Pro |
| 246 | Gemma 3 12B InstructGoogle | 37.51 | Artificial Analysis · MMMU-Pro |
| 247 | Molmo2-8BAllen Institute for AI | 37.46 | Artificial Analysis · MMMU-Pro |
| 248 | Gemini 1.5 Flash-8BGoogle | 36.53 | Artificial Analysis · MMMU-Pro |
| 249 | GPT-5 nano (minimal)OpenAI | 31.79 | Artificial Analysis · MMMU-Pro |
| 250 | Claude 3 HaikuAnthropic | 30.81 | Artificial Analysis · MMMU-Pro |
| 251 | Gemma 3 4B InstructGoogle | 29.94 | Artificial Analysis · MMMU-Pro |
| 252 | Llama 3.2 Instruct 11B (Vision)Meta | 29.31 | Artificial Analysis · MMMU-Pro |
| 253 | LFM2.5-VL-1.6BLiquid AI | 26.53 | Artificial Analysis · MMMU-Pro |
| 254 | Gemma 3n E4B InstructGoogle | 26.24 | Artificial Analysis · MMMU-Pro |
| 255 | Qwen3.5 0.8B (Reasoning)Alibaba | 25.84 | Artificial Analysis · MMMU-Pro |
| 256 | Qwen3.5 0.8B (Non-reasoning)Alibaba | 25.66 | Artificial Analysis · MMMU-Pro |
| 257 | Molmo 7B-DAllen Institute for AI | 24.51 | Artificial Analysis · MMMU-Pro |
| 258 | Phi-4 Multimodal InstructMicrosoft | 14.51 | Artificial Analysis · MMMU-Pro |
일치하는 모델이 없습니다. 검색어를 줄여 보세요.
공개된 숫자만 높은 순으로 표시합니다. 순서가 신뢰구간을 고려한 확정 순위는 아닙니다. AA가 같은 방식으로 평가한 MMMU-Pro 결과입니다. 원래 MMMU validation/test 점수와 다른 표로 분리했습니다.
평가 방법 확인 ↗읽는 법
전체 벤치마크AA가 같은 방식으로 평가한 MMMU-Pro 결과입니다. 원래 MMMU validation/test 점수와 다른 표로 분리했습니다.
AA가 같은 방식으로 평가한 MMMU-Pro 결과입니다. 원래 MMMU validation/test 점수와 다른 표로 분리했습니다.