벤치마크 상세

MMMU-Pro

고난도 이미지 추론: 고난도 이미지 추론

공식 리더보드 보기 AA가 같은 방식으로 평가한 MMMU-Pro 결과입니다. 원래 MMMU validation/test 점수와 다른 표로 분리했습니다.

모든 공개 결과

모델 검색 · 점수순
확인 2026. 09. 07.Artificial Analysis · MMMU-Pro% correct
258개 결과원문 ↗
순서모델 / 실행 구성점수평가 조건·근거
1GPT-6 Astra (max)OpenAI86.88Artificial Analysis · MMMU-Pro
2GPT-6 Astra (high)OpenAI86.42Artificial Analysis · MMMU-Pro
3GPT-6 Astra (xhigh)OpenAI86.24Artificial Analysis · MMMU-Pro
4Gemini 3.8 Flash (high)Google85.61Artificial Analysis · MMMU-Pro
5Gemini 3.7 Flash (high)Google85.49Artificial Analysis · MMMU-Pro
6GPT-6 Astra (medium)OpenAI85.09Artificial Analysis · MMMU-Pro
7Gemini 3.7 Flash (low)Google84.86Artificial Analysis · MMMU-Pro
8Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic84.74Artificial Analysis · MMMU-Pro
9Gemini 3.7 Flash (medium)Google84.74Artificial Analysis · MMMU-Pro
10GPT-6 Astra (low)OpenAI84.62Artificial Analysis · MMMU-Pro
11Gemini 3.8 Flash (low)Google84.51Artificial Analysis · MMMU-Pro
12Gemini 3.5 Flash (high)Google84.28Artificial Analysis · MMMU-Pro
13Gemini 3.8 Flash (medium)Google84.22Artificial Analysis · MMMU-Pro
14Claude Opus 5 (Adaptive Reasoning, Xhigh Effort)Anthropic83.99Artificial Analysis · MMMU-Pro
15Gemini 3.5 Flash (medium)Google83.87Artificial Analysis · MMMU-Pro
16GPT-5.6 Sol (max)OpenAI83.41Artificial Analysis · MMMU-Pro
17Gemini 3.6 Flash (high)Google83.24Artificial Analysis · MMMU-Pro
18GPT-5.6 Sol (xhigh)OpenAI82.66Artificial Analysis · MMMU-Pro
19Claude Opus 5 (Adaptive Reasoning, High Effort)Anthropic82.43Artificial Analysis · MMMU-Pro
20Gemini 3.1 Pro PreviewGoogle82.43Artificial Analysis · MMMU-Pro
21Qwen3.8 MaxAlibaba82.31Artificial Analysis · MMMU-Pro
22GPT-6 Astra (Non-reasoning)OpenAI82.02Artificial Analysis · MMMU-Pro
23Muse Spark 1.3 (xhigh)Meta82.02Artificial Analysis · MMMU-Pro
24GPT-5.6 Sol (high)OpenAI81.85Artificial Analysis · MMMU-Pro
25Claude Opus 5 (Adaptive Reasoning, Medium Effort)Anthropic81.62Artificial Analysis · MMMU-Pro
26GPT-5.6 Sol (medium)OpenAI81.39Artificial Analysis · MMMU-Pro
27GPT-5.5 (medium)OpenAI81.16Artificial Analysis · MMMU-Pro
28GPT-5.5 (high)OpenAI81.1Artificial Analysis · MMMU-Pro
29GPT-5.6 Sol (low)OpenAI80.98Artificial Analysis · MMMU-Pro
30GPT-5.6 Terra (max)OpenAI80.69Artificial Analysis · MMMU-Pro
31Muse SparkMeta80.52Artificial Analysis · MMMU-Pro
32Kimi K3 (max)Kimi80.52Artificial Analysis · MMMU-Pro
33Qwen3.7 PlusAlibaba80.46Artificial Analysis · MMMU-Pro
34Grok 4.5 (high)SpaceXAI80.4Artificial Analysis · MMMU-Pro
35Gemini 3 Pro Preview (high)Google80.17Artificial Analysis · MMMU-Pro
36Gemini 3.5 Flash (minimal)Google80.12Artificial Analysis · MMMU-Pro
37Gemini 3 Flash Preview (Reasoning)Google79.94Artificial Analysis · MMMU-Pro
38GPT-5.5 (xhigh)OpenAI79.88Artificial Analysis · MMMU-Pro
39Claude Opus 5 (Adaptive Reasoning, Low Effort)Anthropic79.83Artificial Analysis · MMMU-Pro
40Qwen3.8-Flash-NextAlibaba79.77Artificial Analysis · MMMU-Pro
41GPT-5.6 Terra (xhigh)OpenAI79.48Artificial Analysis · MMMU-Pro
42Kimi K2.6Kimi79.36Artificial Analysis · MMMU-Pro
43Apodex 1.1Apodex79.19Artificial Analysis · MMMU-Pro
44GPT-5.6 Terra (high)OpenAI79.08Artificial Analysis · MMMU-Pro
45Gemini 3.5 Flash-LiteGoogle79.02Artificial Analysis · MMMU-Pro
46GPT-5.5 (low)OpenAI79.02Artificial Analysis · MMMU-Pro
47Claude Opus 4.7 (Adaptive Reasoning, Max Effort)Anthropic78.84Artificial Analysis · MMMU-Pro
48MiniMax-M3MiniMax78.55Artificial Analysis · MMMU-Pro
49GPT-5.6 Luna (max)OpenAI78.55Artificial Analysis · MMMU-Pro
50Gemini 3 Flash Preview (Non-reasoning)Google78.55Artificial Analysis · MMMU-Pro
51GPT-5.6 Luna (xhigh)OpenAI78.55Artificial Analysis · MMMU-Pro
52Kimi K3 (low)Kimi78.5Artificial Analysis · MMMU-Pro
53GPT-5.3 Codex (xhigh)OpenAI78.5Artificial Analysis · MMMU-Pro
54GPT-5.4 (xhigh)OpenAI78.44Artificial Analysis · MMMU-Pro
55Grok 4.3 (high)SpaceXAI78.09Artificial Analysis · MMMU-Pro
56GPT-5.4 (low)OpenAI77.98Artificial Analysis · MMMU-Pro
57Qwen3.6 PlusAlibaba77.98Artificial Analysis · MMMU-Pro
58GPT-5.6 Luna (high)OpenAI77.57Artificial Analysis · MMMU-Pro
59Qwen3.5 397B A17B (Reasoning)Alibaba77.28Artificial Analysis · MMMU-Pro
60Claude Sonnet 5 (Adaptive Reasoning, Max Effort)Anthropic77.28Artificial Analysis · MMMU-Pro
61GPT-5.6 Terra (medium)OpenAI76.76Artificial Analysis · MMMU-Pro
62Grok Build 0.1 0616SpaceXAI76.53Artificial Analysis · MMMU-Pro
63Claude Opus 4.7 (Non-reasoning, High Effort)Anthropic76.36Artificial Analysis · MMMU-Pro
64GPT-5.2 Codex (xhigh)OpenAI76.3Artificial Analysis · MMMU-Pro
65Qwen3.8 27B (xhigh)Alibaba76.3Artificial Analysis · MMMU-Pro
66GPT-5.6 Terra (low)OpenAI76.13Artificial Analysis · MMMU-Pro
67GPT-5.6 Luna (medium)OpenAI75.84Artificial Analysis · MMMU-Pro
68Grok 4.3 (medium)SpaceXAI75.84Artificial Analysis · MMMU-Pro
69Gemini 3.1 Flash-LiteGoogle75.55Artificial Analysis · MMMU-Pro
70GPT-5.1 (high)OpenAI75.49Artificial Analysis · MMMU-Pro
71MiMo-V2.5Xiaomi75.43Artificial Analysis · MMMU-Pro
72Claude Opus 4.6 (Adaptive Reasoning, Max Effort)Anthropic75.43Artificial Analysis · MMMU-Pro
73Agnes 2.5 Pro BetaSapiens AI75.43Artificial Analysis · MMMU-Pro
74Kimi K2.5 (Reasoning)Kimi75.38Artificial Analysis · MMMU-Pro
75Step 3.7 FlashStepFun75.32Artificial Analysis · MMMU-Pro
76Qwen3.5 27B (Reasoning)Alibaba75.03Artificial Analysis · MMMU-Pro
77Qwen3.6 35B A3B (Reasoning)Alibaba75.03Artificial Analysis · MMMU-Pro
78Qwen3.5 122B A10B (Reasoning)Alibaba74.97Artificial Analysis · MMMU-Pro
79Gemini 2.5 ProGoogle74.91Artificial Analysis · MMMU-Pro
80DeepSeek V4 Flash Vision (Reasoning, Max Effort)DeepSeek74.8Artificial Analysis · MMMU-Pro
81Qwen3.6 27B (Reasoning)Alibaba74.62Artificial Analysis · MMMU-Pro
82GPT-5.2 (medium)OpenAI74.57Artificial Analysis · MMMU-Pro
83Grok 4.20 0309 v2 (Reasoning)SpaceXAI74.57Artificial Analysis · MMMU-Pro
84Muse Glimmer (high)Meta74.34Artificial Analysis · MMMU-Pro
85GPT-5 (medium)OpenAI74.34Artificial Analysis · MMMU-Pro
86GPT-5 (high)OpenAI74.22Artificial Analysis · MMMU-Pro
87Qwen3.8 27B (medium)Alibaba74.16Artificial Analysis · MMMU-Pro
88Claude Opus 4.5 (Reasoning)Anthropic74.05Artificial Analysis · MMMU-Pro
89Inkling SmallThinking Machines74.05Artificial Analysis · MMMU-Pro
90GPT-5.6 Luna (low)OpenAI73.99Artificial Analysis · MMMU-Pro
91MiMo-V2-Omni-0327Xiaomi73.93Artificial Analysis · MMMU-Pro
92GPT-5 Codex (high)OpenAI73.82Artificial Analysis · MMMU-Pro
93Qwen3.8 27B (low)Alibaba73.76Artificial Analysis · MMMU-Pro
94GPT-5 (low)OpenAI73.76Artificial Analysis · MMMU-Pro
95Inkling (xhigh)Thinking Machines73.47Artificial Analysis · MMMU-Pro
96Gemma 4 31B (Reasoning)Google73.41Artificial Analysis · MMMU-Pro
97GPT-5.4 mini (xhigh)OpenAI73.29Artificial Analysis · MMMU-Pro
98Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort)Anthropic73.29Artificial Analysis · MMMU-Pro
99Grok 4.20 0309 (Reasoning)SpaceXAI73.18Artificial Analysis · MMMU-Pro
100Gemini 2.5 Flash Preview (Sep '25) (Reasoning)Google73.12Artificial Analysis · MMMU-Pro
101Kimi K2.5 (Non-reasoning)Kimi73.06Artificial Analysis · MMMU-Pro
102GLM 5V Turbo (Reasoning)Z AI72.77Artificial Analysis · MMMU-Pro
103Grok 4.3 (low)SpaceXAI72.77Artificial Analysis · MMMU-Pro
104Qwen3.5 35B A3B (Reasoning)Alibaba72.66Artificial Analysis · MMMU-Pro
105Claude Opus 4.6 (Non-reasoning, High Effort)Anthropic72.54Artificial Analysis · MMMU-Pro
106GPT-5.1 Codex (high)OpenAI72.49Artificial Analysis · MMMU-Pro
107GPT-5.6 Sol (Non-reasoning)OpenAI71.91Artificial Analysis · MMMU-Pro
108Claude Sonnet 5 (Non-reasoning, High Effort)Anthropic71.91Artificial Analysis · MMMU-Pro
109Qwen3.6 27B (Non-reasoning)Alibaba71.73Artificial Analysis · MMMU-Pro
110GPT-5.5 (Non-reasoning)OpenAI71.39Artificial Analysis · MMMU-Pro
111Claude Opus 4.5 (Non-reasoning)Anthropic71.21Artificial Analysis · MMMU-Pro
112GPT-5.4 mini (medium)OpenAI71.16Artificial Analysis · MMMU-Pro
113Qwen3.6 35B A3B (Non-reasoning)Alibaba71.04Artificial Analysis · MMMU-Pro
114Claude Sonnet 4.6 (Non-reasoning, High Effort)Anthropic70.58Artificial Analysis · MMMU-Pro
115GPT-5.4 (Non-reasoning)OpenAI70.58Artificial Analysis · MMMU-Pro
116Qwen3.5 Omni PlusAlibaba70.52Artificial Analysis · MMMU-Pro
117Gemma 4 31B (Non-reasoning)Google70.35Artificial Analysis · MMMU-Pro
118Qwen3.5 122B A10B (Non-reasoning)Alibaba70.29Artificial Analysis · MMMU-Pro
119Gemini 2.5 Flash Preview (Sep '25) (Non-reasoning)Google70.23Artificial Analysis · MMMU-Pro
120o3OpenAI70.06Artificial Analysis · MMMU-Pro
121GPT-5 mini (high)OpenAI70.06Artificial Analysis · MMMU-Pro
122Qwen3.5 27B (Non-reasoning)Alibaba70Artificial Analysis · MMMU-Pro
123Qwen3.8 27B (Non-reasoning)Alibaba69.94Artificial Analysis · MMMU-Pro
124MiMo-V2-OmniXiaomi69.88Artificial Analysis · MMMU-Pro
125Gemma 4 12B (Reasoning)Google69.65Artificial Analysis · MMMU-Pro
126Qwen3.5 9B (Reasoning)Alibaba69.25Artificial Analysis · MMMU-Pro
127Gemma 4 26B A4B (Reasoning)Google69.25Artificial Analysis · MMMU-Pro
128o4-mini (high)OpenAI69.25Artificial Analysis · MMMU-Pro
129Qwen3.5 35B A3B (Non-reasoning)Alibaba69.19Artificial Analysis · MMMU-Pro
130Claude Sonnet 4.6 (Non-reasoning, Low Effort)Anthropic69.19Artificial Analysis · MMMU-Pro
131Gemini 2.5 Flash (Reasoning)Google69.08Artificial Analysis · MMMU-Pro
132GPT-5.1 Codex mini (high)OpenAI69.02Artificial Analysis · MMMU-Pro
133Grok 4SpaceXAI68.84Artificial Analysis · MMMU-Pro
134GPT-5 mini (medium)OpenAI68.84Artificial Analysis · MMMU-Pro
135Claude 4.5 Sonnet (Reasoning)Anthropic68.73Artificial Analysis · MMMU-Pro
136Qwen3 VL 235B A22B (Reasoning)Alibaba68.73Artificial Analysis · MMMU-Pro
137Doubao Seed CodeByteDance Seed68.09Artificial Analysis · MMMU-Pro
138Claude 4.1 Opus (Reasoning)Anthropic67.92Artificial Analysis · MMMU-Pro
139Qwen3 VL 235B A22B InstructAlibaba67.57Artificial Analysis · MMMU-Pro
140EXAONE 4.5 33BLG AI Research67.34Artificial Analysis · MMMU-Pro
141Qwen3.5 9B (Non-reasoning)Alibaba66.76Artificial Analysis · MMMU-Pro
142Gemma 4 26B A4B (Non-reasoning)Google66.71Artificial Analysis · MMMU-Pro
143GPT-5.6 Terra (Non-reasoning)OpenAI66.71Artificial Analysis · MMMU-Pro
144DiffusionGemma 26B A4BGoogle66.53Artificial Analysis · MMMU-Pro
145GPT-5.2 (Non-reasoning)OpenAI65.84Artificial Analysis · MMMU-Pro
146Gemini 2.5 Flash (Non-reasoning)Google65.49Artificial Analysis · MMMU-Pro
147Qwen3.5 4B (Reasoning)Alibaba65.38Artificial Analysis · MMMU-Pro
148GPT-5.4 nano (xhigh)OpenAI65.38Artificial Analysis · MMMU-Pro
149Claude 4.5 Sonnet (Non-reasoning)Anthropic65.2Artificial Analysis · MMMU-Pro
150Gemini 2.5 Flash-Lite Preview (Sep '25) (Reasoning)Google64.97Artificial Analysis · MMMU-Pro
151Grok 4.20 0309 v2 (Non-reasoning)SpaceXAI64.91Artificial Analysis · MMMU-Pro
152Mistral Medium 3.5Mistral64.86Artificial Analysis · MMMU-Pro
153Grok 4.3 (Non-reasoning)SpaceXAI64.8Artificial Analysis · MMMU-Pro
154Qwen3.5 Omni FlashAlibaba64.74Artificial Analysis · MMMU-Pro
155ERNIE 5.0 Thinking PreviewBaidu64.57Artificial Analysis · MMMU-Pro
156Nova 2.0 Pro Preview (medium)Amazon64.51Artificial Analysis · MMMU-Pro
157Qwen3 VL 32B InstructAlibaba64.28Artificial Analysis · MMMU-Pro
158JT-4.1 Flash 236B A21BChina Mobile64.1Artificial Analysis · MMMU-Pro
159Grok 4.20 0309 (Non-reasoning)SpaceXAI64.05Artificial Analysis · MMMU-Pro
160Step3 VL 10BStepFun63.99Artificial Analysis · MMMU-Pro
161Nova 2.0 Lite (high)Amazon63.76Artificial Analysis · MMMU-Pro
162Gemini 2.5 Flash-Lite Preview (Sep '25) (Non-reasoning)Google63.41Artificial Analysis · MMMU-Pro
163Qwen3 VL 32B (Reasoning)Alibaba63.41Artificial Analysis · MMMU-Pro
164Grok 4.1 Fast (Reasoning)SpaceXAI63.29Artificial Analysis · MMMU-Pro
165Command A+Cohere63.24Artificial Analysis · MMMU-Pro
166Nova 2.0 Pro Preview (low)Amazon62.72Artificial Analysis · MMMU-Pro
167Nova 2.0 Lite (medium)Amazon62.54Artificial Analysis · MMMU-Pro
168Claude 4 Sonnet (Non-reasoning)Anthropic62.37Artificial Analysis · MMMU-Pro
169GPT-5.1 (Non-reasoning)OpenAI62.37Artificial Analysis · MMMU-Pro
170Qwen3 VL 30B A3B InstructAlibaba62.14Artificial Analysis · MMMU-Pro
171Llama 4 MaverickMeta62.14Artificial Analysis · MMMU-Pro
172Qwen3.5 4B (Non-reasoning)Alibaba62.08Artificial Analysis · MMMU-Pro
173GPT-5 (minimal)OpenAI62.08Artificial Analysis · MMMU-Pro
174Gemma 4 12B (Non-reasoning)Google61.97Artificial Analysis · MMMU-Pro
175Gemini 2.5 Flash Preview (Non-reasoning)Google61.97Artificial Analysis · MMMU-Pro
176Nova 2.0 Omni (medium)Amazon61.91Artificial Analysis · MMMU-Pro
177Qwen3 VL 30B A3B (Reasoning)Alibaba61.85Artificial Analysis · MMMU-Pro
178Grok 4 Fast (Reasoning)SpaceXAI61.79Artificial Analysis · MMMU-Pro
179Claude 4 Sonnet (Reasoning)Anthropic61.79Artificial Analysis · MMMU-Pro
180GPT-4.1OpenAI61.21Artificial Analysis · MMMU-Pro
181GPT-5 nano (high)OpenAI60.98Artificial Analysis · MMMU-Pro
182GPT-5.4 mini (Non-Reasoning)OpenAI60.46Artificial Analysis · MMMU-Pro
183GPT-5.6 Luna (Non-reasoning)OpenAI60.35Artificial Analysis · MMMU-Pro
184Qwen3 Omni 30B A3B (Reasoning)Alibaba60.23Artificial Analysis · MMMU-Pro
185Claude 3.7 Sonnet (Non-reasoning)Anthropic60.06Artificial Analysis · MMMU-Pro
186Nova 2.0 Omni (low)Amazon59.83Artificial Analysis · MMMU-Pro
187Magistral Medium 1.2Mistral59.65Artificial Analysis · MMMU-Pro
188GPT-5.4 nano (medium)OpenAI59.54Artificial Analysis · MMMU-Pro
189GPT-4.1 miniOpenAI58.73Artificial Analysis · MMMU-Pro
190Claude 4.5 Haiku (Reasoning)Anthropic58.55Artificial Analysis · MMMU-Pro
191GPT-5 mini (minimal)OpenAI58.38Artificial Analysis · MMMU-Pro
192GPT-5 nano (medium)OpenAI58.21Artificial Analysis · MMMU-Pro
193Gemini 2.5 Flash-Lite (Reasoning)Google58.21Artificial Analysis · MMMU-Pro
194Nova 2.0 Lite (low)Amazon57.98Artificial Analysis · MMMU-Pro
195Apriel-v1.5-15B-ThinkerServiceNow57.05Artificial Analysis · MMMU-Pro
196Mistral Small 4 (Reasoning)Mistral56.82Artificial Analysis · MMMU-Pro
197Qwen3 VL 8B (Reasoning)Alibaba56.65Artificial Analysis · MMMU-Pro
198GPT-4o (Aug '24)OpenAI56.3Artificial Analysis · MMMU-Pro
199Mistral Large 3Mistral55.66Artificial Analysis · MMMU-Pro
200Qwen3 Omni 30B A3B InstructAlibaba55.49Artificial Analysis · MMMU-Pro
201Magistral Small 1.2Mistral55.49Artificial Analysis · MMMU-Pro
202Claude 4.5 Haiku (Non-reasoning)Anthropic55.14Artificial Analysis · MMMU-Pro
203Gemini 1.5 Pro (Sep '24)Google55.03Artificial Analysis · MMMU-Pro
204Mistral Medium 3.1Mistral54.16Artificial Analysis · MMMU-Pro
205Gemini 2.5 Flash-Lite (Non-reasoning)Google53.99Artificial Analysis · MMMU-Pro
206Nemotron 3 Nano Omni 30B A3B ReasoningNVIDIA53.18Artificial Analysis · MMMU-Pro
207Mistral Medium 3Mistral53.01Artificial Analysis · MMMU-Pro
208Llama 4 ScoutMeta52.95Artificial Analysis · MMMU-Pro
209NVIDIA Nemotron Nano 12B v2 VL (Reasoning)NVIDIA52.89Artificial Analysis · MMMU-Pro
210Qwen3.5 397B A17B (Non-reasoning)Alibaba52.66Artificial Analysis · MMMU-Pro
211Qwen3 VL 4B (Reasoning)Alibaba52.02Artificial Analysis · MMMU-Pro
212Gemma 4 E4B (Reasoning)Google51.39Artificial Analysis · MMMU-Pro
213Gemma 4 E4B (Non-reasoning)Google51.21Artificial Analysis · MMMU-Pro
214Pixtral LargeMistral50.58Artificial Analysis · MMMU-Pro
215GLM-4.5V (Reasoning)Z AI50.46Artificial Analysis · MMMU-Pro
216Nova 2.0 Omni (Non-reasoning)Amazon49.88Artificial Analysis · MMMU-Pro
217Ministral 3 14BMistral49.83Artificial Analysis · MMMU-Pro
218Nova 2.0 Lite (Non-reasoning)Amazon49.02Artificial Analysis · MMMU-Pro
219GLM-4.6V (Reasoning)Z AI48.55Artificial Analysis · MMMU-Pro
220Grok 4.1 Fast (Non-reasoning)SpaceXAI48.44Artificial Analysis · MMMU-Pro
221Gemini 1.5 Flash (Sep '24)Google48.38Artificial Analysis · MMMU-Pro
222Grok 4 Fast (Non-reasoning)SpaceXAI48.09Artificial Analysis · MMMU-Pro
223Gemma 3 27B InstructGoogle48.03Artificial Analysis · MMMU-Pro
224Mistral Small 3.2Mistral47.98Artificial Analysis · MMMU-Pro
225Qwen3 VL 8B InstructAlibaba47.34Artificial Analysis · MMMU-Pro
226Mistral Small 4 (Non-reasoning)Mistral46.47Artificial Analysis · MMMU-Pro
227Ministral 3 8BMistral45.95Artificial Analysis · MMMU-Pro
228Claude 3.5 HaikuAnthropic45.61Artificial Analysis · MMMU-Pro
229Devstral Small 2Mistral44.62Artificial Analysis · MMMU-Pro
230Gemma 4 E2B (Reasoning)Google44.57Artificial Analysis · MMMU-Pro
231NVIDIA Nemotron Nano 12B v2 VL (Non-reasoning)NVIDIA44.51Artificial Analysis · MMMU-Pro
232Nova ProAmazon44.34Artificial Analysis · MMMU-Pro
233Qwen3 VL 4B InstructAlibaba43.87Artificial Analysis · MMMU-Pro
234GPT-5.4 nano (Non-Reasoning)OpenAI43.76Artificial Analysis · MMMU-Pro
235Qwen3.5 2B (Reasoning)Alibaba43.01Artificial Analysis · MMMU-Pro
236GLM-4.5V (Non-reasoning)Z AI42.77Artificial Analysis · MMMU-Pro
237Qwen3.5 2B (Non-reasoning)Alibaba42.66Artificial Analysis · MMMU-Pro
238GLM-4.6V (Non-reasoning)Z AI42.2Artificial Analysis · MMMU-Pro
239Gemma 4 E2B (Non-reasoning)Google41.79Artificial Analysis · MMMU-Pro
240GPT-4o miniOpenAI41.5Artificial Analysis · MMMU-Pro
241GPT-4.1 nanoOpenAI40.12Artificial Analysis · MMMU-Pro
242Llama 3.2 Instruct 90B (Vision)Meta39.48Artificial Analysis · MMMU-Pro
243Ministral 3 3BMistral38.09Artificial Analysis · MMMU-Pro
244MiniCPM-V 4.6 1.3BOpenBMB37.92Artificial Analysis · MMMU-Pro
245Nova LiteAmazon37.8Artificial Analysis · MMMU-Pro
246Gemma 3 12B InstructGoogle37.51Artificial Analysis · MMMU-Pro
247Molmo2-8BAllen Institute for AI37.46Artificial Analysis · MMMU-Pro
248Gemini 1.5 Flash-8BGoogle36.53Artificial Analysis · MMMU-Pro
249GPT-5 nano (minimal)OpenAI31.79Artificial Analysis · MMMU-Pro
250Claude 3 HaikuAnthropic30.81Artificial Analysis · MMMU-Pro
251Gemma 3 4B InstructGoogle29.94Artificial Analysis · MMMU-Pro
252Llama 3.2 Instruct 11B (Vision)Meta29.31Artificial Analysis · MMMU-Pro
253LFM2.5-VL-1.6BLiquid AI26.53Artificial Analysis · MMMU-Pro
254Gemma 3n E4B InstructGoogle26.24Artificial Analysis · MMMU-Pro
255Qwen3.5 0.8B (Reasoning)Alibaba25.84Artificial Analysis · MMMU-Pro
256Qwen3.5 0.8B (Non-reasoning)Alibaba25.66Artificial Analysis · MMMU-Pro
257Molmo 7B-DAllen Institute for AI24.51Artificial Analysis · MMMU-Pro
258Phi-4 Multimodal InstructMicrosoft14.51Artificial Analysis · MMMU-Pro

공개된 숫자만 높은 순으로 표시합니다. 순서가 신뢰구간을 고려한 확정 순위는 아닙니다. AA가 같은 방식으로 평가한 MMMU-Pro 결과입니다. 원래 MMMU validation/test 점수와 다른 표로 분리했습니다.

평가 방법 확인 ↗

AA가 같은 방식으로 평가한 MMMU-Pro 결과입니다. 원래 MMMU validation/test 점수와 다른 표로 분리했습니다.

AA가 같은 방식으로 평가한 MMMU-Pro 결과입니다. 원래 MMMU validation/test 점수와 다른 표로 분리했습니다.