벤치마크 상세

LiveBench

최신 종합 평가: 최신 모델의 수학, 코딩, 추론, 언어 이해 흐름을 빠르게 볼 때

공식 리더보드 보기 공식 LiveBench 방식에 맞춰 분야별 평균을 먼저 계산하고, 공개된 분야 평균을 다시 동일 가중치로 평균했습니다. 해당 릴리스에 공개된 모델 전체를 담습니다.

모든 공개 결과

모델 검색 · 점수순
확인 2026. 09. 11.2026-06-25 releasemean of 7 category averages
57개 결과원문 ↗
순서모델 / 실행 구성점수평가 조건·근거
1claude-fable-5-1-max-effort83.412026-06-25 release
2claude-fable-5-max-effort82.972026-06-25 release
3gpt-6-astra-max82.162026-06-25 release
4muse-spark-1.3-xhigh81.592026-06-25 release
5deepseek-v4.1-flash-max81.112026-06-25 release
6gpt-5.6-sol-max81.052026-06-25 release
7gpt-5.5-xhigh80.192026-06-25 release
8claude-opus-5-max-effort80.082026-06-25 release
9smaug-agentic79.512026-06-25 release
10kimi-k379.192026-06-25 release
11gemini-3.7-flash-high78.832026-06-25 release
12qwen3.8-max78.462026-06-25 release
13grok-4.678.042026-06-25 release
14gpt-5.4-xhigh77.972026-06-25 release
15muse-spark-1.2-xhigh77.952026-06-25 release
16gpt-5.6-terra-max77.942026-06-25 release
17deepseek-v4-pro-081377.442026-06-25 release
18smaug-flash77.442026-06-25 release
19gemini-3.1-pro-preview-high76.952026-06-25 release
20smaug-mini76.932026-06-25 release
21deepseek-v4-flash-vision-exp76.762026-06-25 release
22claude-opus-4-7-xhigh-effort76.532026-06-25 release
23claude-opus-4-8-max-effort76.222026-06-25 release
24qwen3.8-flash-next76.192026-06-25 release
25glm-5.376.142026-06-25 release
26claude-sonnet-5-xhigh-effort76.042026-06-25 release
27gemini-3.8-flash-high75.832026-06-25 release
28grok-4.575.772026-06-25 release
29muse-spark-1.1-xhigh75.32026-06-25 release
30qwen3.8-27b75.272026-06-25 release
31gemini-3.5-flash-high74.642026-06-25 release
32gpt-5.2-2025-12-11-high74.632026-06-25 release
33claude-opus-4-6-thinking-auto-high-effort74.522026-06-25 release
34deepseek-v4-flash-073174.172026-06-25 release
35gpt-5.2-codex73.982026-06-25 release
36gemini-3.6-flash-high73.592026-06-25 release
37gpt-5.6-luna-max73.562026-06-25 release
38glm-5.273.162026-06-25 release
39qwen3.7-max73.142026-06-25 release
40claude-sonnet-4-6-thinking-auto-medium-effort72.992026-06-25 release
41claude-opus-4-5-20251101-thinking-64k-high-effort72.582026-06-25 release
42inkling-xhigh71.922026-06-25 release
43glm-5.3-flash71.592026-06-25 release
44deepseek-v4-pro71.572026-06-25 release
45kimi-k2.6-thinking70.542026-06-25 release
46gpt-5.4-nano-xhigh69.582026-06-25 release
47ox-alpha-max69.242026-06-25 release
48qwen3.6-plus68.912026-06-25 release
49kimi-k2.7-code68.412026-06-25 release
50grok-build-0.167.782026-06-25 release
51nemotron-3-ultra-550b-a55b67.362026-06-25 release
52minimax-m367.262026-06-25 release
53gpt-5.4-mini-xhigh66.372026-06-25 release
54deepseek-v4-flash65.482026-06-25 release
55qwen3.6-27b64.032026-06-25 release
56gemini-3.5-flash-lite-high63.942026-06-25 release
57grok-4.362.252026-06-25 release

공개된 숫자만 높은 순으로 표시합니다. 순서가 신뢰구간을 고려한 확정 순위는 아닙니다. 공식 LiveBench 방식에 맞춰 분야별 평균을 먼저 계산하고, 공개된 분야 평균을 다시 동일 가중치로 평균했습니다. 해당 릴리스에 공개된 모델 전체를 담습니다.

평가 방법 확인 ↗

오염을 줄이기 위해 새 문제를 계속 추가하는 최신 LLM 종합 리더보드입니다.

고정된 오래된 시험보다 최신 모델 간 상대적 흐름을 보기에 좋습니다. 세부 task별 점수를 함께 봐야 합니다.