벤치마크 상세
LiveBench
최신 종합 평가: 최신 모델의 수학, 코딩, 추론, 언어 이해 흐름을 빠르게 볼 때
공식 리더보드 보기
공식 LiveBench 방식에 맞춰 분야별 평균을 먼저 계산하고, 공개된 분야 평균을 다시 동일 가중치로 평균했습니다. 해당 릴리스에 공개된 모델 전체를 담습니다.
모든 공개 결과
모델 검색 · 점수순확인 2026. 09. 11.2026-06-25 releasemean of 7 category averages
57개 결과원문 ↗
| 순서 | 모델 / 실행 구성 | 점수 | 평가 조건·근거 |
|---|---|---|---|
| 1 | claude-fable-5-1-max-effort | 83.41 | 2026-06-25 release |
| 2 | claude-fable-5-max-effort | 82.97 | 2026-06-25 release |
| 3 | gpt-6-astra-max | 82.16 | 2026-06-25 release |
| 4 | muse-spark-1.3-xhigh | 81.59 | 2026-06-25 release |
| 5 | deepseek-v4.1-flash-max | 81.11 | 2026-06-25 release |
| 6 | gpt-5.6-sol-max | 81.05 | 2026-06-25 release |
| 7 | gpt-5.5-xhigh | 80.19 | 2026-06-25 release |
| 8 | claude-opus-5-max-effort | 80.08 | 2026-06-25 release |
| 9 | smaug-agentic | 79.51 | 2026-06-25 release |
| 10 | kimi-k3 | 79.19 | 2026-06-25 release |
| 11 | gemini-3.7-flash-high | 78.83 | 2026-06-25 release |
| 12 | qwen3.8-max | 78.46 | 2026-06-25 release |
| 13 | grok-4.6 | 78.04 | 2026-06-25 release |
| 14 | gpt-5.4-xhigh | 77.97 | 2026-06-25 release |
| 15 | muse-spark-1.2-xhigh | 77.95 | 2026-06-25 release |
| 16 | gpt-5.6-terra-max | 77.94 | 2026-06-25 release |
| 17 | deepseek-v4-pro-0813 | 77.44 | 2026-06-25 release |
| 18 | smaug-flash | 77.44 | 2026-06-25 release |
| 19 | gemini-3.1-pro-preview-high | 76.95 | 2026-06-25 release |
| 20 | smaug-mini | 76.93 | 2026-06-25 release |
| 21 | deepseek-v4-flash-vision-exp | 76.76 | 2026-06-25 release |
| 22 | claude-opus-4-7-xhigh-effort | 76.53 | 2026-06-25 release |
| 23 | claude-opus-4-8-max-effort | 76.22 | 2026-06-25 release |
| 24 | qwen3.8-flash-next | 76.19 | 2026-06-25 release |
| 25 | glm-5.3 | 76.14 | 2026-06-25 release |
| 26 | claude-sonnet-5-xhigh-effort | 76.04 | 2026-06-25 release |
| 27 | gemini-3.8-flash-high | 75.83 | 2026-06-25 release |
| 28 | grok-4.5 | 75.77 | 2026-06-25 release |
| 29 | muse-spark-1.1-xhigh | 75.3 | 2026-06-25 release |
| 30 | qwen3.8-27b | 75.27 | 2026-06-25 release |
| 31 | gemini-3.5-flash-high | 74.64 | 2026-06-25 release |
| 32 | gpt-5.2-2025-12-11-high | 74.63 | 2026-06-25 release |
| 33 | claude-opus-4-6-thinking-auto-high-effort | 74.52 | 2026-06-25 release |
| 34 | deepseek-v4-flash-0731 | 74.17 | 2026-06-25 release |
| 35 | gpt-5.2-codex | 73.98 | 2026-06-25 release |
| 36 | gemini-3.6-flash-high | 73.59 | 2026-06-25 release |
| 37 | gpt-5.6-luna-max | 73.56 | 2026-06-25 release |
| 38 | glm-5.2 | 73.16 | 2026-06-25 release |
| 39 | qwen3.7-max | 73.14 | 2026-06-25 release |
| 40 | claude-sonnet-4-6-thinking-auto-medium-effort | 72.99 | 2026-06-25 release |
| 41 | claude-opus-4-5-20251101-thinking-64k-high-effort | 72.58 | 2026-06-25 release |
| 42 | inkling-xhigh | 71.92 | 2026-06-25 release |
| 43 | glm-5.3-flash | 71.59 | 2026-06-25 release |
| 44 | deepseek-v4-pro | 71.57 | 2026-06-25 release |
| 45 | kimi-k2.6-thinking | 70.54 | 2026-06-25 release |
| 46 | gpt-5.4-nano-xhigh | 69.58 | 2026-06-25 release |
| 47 | ox-alpha-max | 69.24 | 2026-06-25 release |
| 48 | qwen3.6-plus | 68.91 | 2026-06-25 release |
| 49 | kimi-k2.7-code | 68.41 | 2026-06-25 release |
| 50 | grok-build-0.1 | 67.78 | 2026-06-25 release |
| 51 | nemotron-3-ultra-550b-a55b | 67.36 | 2026-06-25 release |
| 52 | minimax-m3 | 67.26 | 2026-06-25 release |
| 53 | gpt-5.4-mini-xhigh | 66.37 | 2026-06-25 release |
| 54 | deepseek-v4-flash | 65.48 | 2026-06-25 release |
| 55 | qwen3.6-27b | 64.03 | 2026-06-25 release |
| 56 | gemini-3.5-flash-lite-high | 63.94 | 2026-06-25 release |
| 57 | grok-4.3 | 62.25 | 2026-06-25 release |
일치하는 모델이 없습니다. 검색어를 줄여 보세요.
공개된 숫자만 높은 순으로 표시합니다. 순서가 신뢰구간을 고려한 확정 순위는 아닙니다. 공식 LiveBench 방식에 맞춰 분야별 평균을 먼저 계산하고, 공개된 분야 평균을 다시 동일 가중치로 평균했습니다. 해당 릴리스에 공개된 모델 전체를 담습니다.
평가 방법 확인 ↗읽는 법
전체 벤치마크오염을 줄이기 위해 새 문제를 계속 추가하는 최신 LLM 종합 리더보드입니다.
고정된 오래된 시험보다 최신 모델 간 상대적 흐름을 보기에 좋습니다. 세부 task별 점수를 함께 봐야 합니다.