벤치마크 · 2026.09.07 확인

작업에 맞는 모델을 비교하세요

모델을 고르는 기준은 작업마다 다릅니다. 같은 평가 안에서 점수와 실험 조건을 함께 비교하세요.

23개 평가4,050개 공개 결과추정치 제외 · 원문 연결
최신 종합 평가

LiveBench

2026-06-25 release

claude-fable-5-1-max-effort83.41
동일 하네스 코딩 비교

SWE-bench Verified 500

SWE-bench Verified 500 · mini-SWE-agent 2.0.0

Claude 4.5 Opus (high)76.8
다언어 저장소 이슈 해결

SWE-bench Multilingual 300

SWE-bench Multilingual 300 · mini-SWE-agent 2.0.0a0

Gemini 3 Flash72.7
기존 코드 편집 성공률

Aider Polyglot

225-case polyglot leaderboard

gpt-5 (high) · diff88
사람이 선호하는 답변

Arena Text / LMArena

Text Overall · Style Control ON

claude-fable-51507.16
최신 종합 지능

Artificial Analysis Intelligence Index

v4.2 · 2026-09-04

Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)56.76
대학원 수준 과학 추론

GPQA Diamond

Artificial Analysis · GPQA Diamond

GPT-6 Astra (xhigh)96.26
고난도 학술 문제

Humanity's Last Exam

AA · 2,158 text-only questions · May 2025 revision

Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)59.13
고객지원 도구 사용

TAU-bench / τ²-Bench Telecom

AA · τ²-Bench Telecom

JT-35B-Flash99.12
고난도 이미지 추론

MMMU-Pro

Artificial Analysis · MMMU-Pro

GPT-6 Astra (max)86.88
긴 문서 통합 추론

AA-LCR

AA-LCR v1.1 · September 2026

Kimi K3 (max)88.67
과학 분야 코드 작성

SciCode

SciCode v1.0.1 · Artificial Analysis

Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)63.08
터미널에서 실제 작업 완수

Terminal-Bench 4.0

Terminal-Bench 4.0 · official leaderboard

GPT-6 Astra · Codex · max58.18
함수 호출과 도구 실행 정확도

BFCL V4

BFCL V4 · f7cf735 · bfcl-eval 2025.12.17

Claude-Opus-4-5-20251101 (FC)77.47
최근 알고리즘 문제 풀이

LiveCodeBench

Code generation · 2024-08-01–2025-05-01

O4-Mini (High)80.18
폭넓은 전문 지식

MMLU-Pro

TIGER-Lab public leaderboard · Overall

Gemini-3.1-Pro91.16
이미지와 전문 지식을 함께 이해

MMMU

MMMU validation · Overall

GPT-5.185.4
긴 문서의 근거를 따라 추론

LongBench v2

LongBench v2 · Overall w/ CoT

Gemini-2.5-Pro Google63.3
경시대회 수학

AIME 2026

MathArena · AIME 2026

GPT-5.5 (xhigh)100
문서 이미지에서 답 찾기

DocVQA

DocVQA · single-document VQA · official submissions

ORCA97.29
어려운 이미지 질의응답

VibeEval

Vibe-Eval v1 · all split · archived public table

Gemini Flash 2.067.1
여러 능력의 균형

HELM Capabilities

HELM Capabilities v1.15.0 · Core Scenarios

GPT-5 mini (2025-08-07)81.9
문맥 위치에 따른 정보 회수

Needle-in-a-Haystack

Original Claude 2.1 experiment · historical archive

Claude 2.1 · 원저자 공개 실험6.42

숫자를 읽기 전에

평가 버전, 추론 강도, 도구와 에이전트 설정이 다르면 점수를 직접 비교할 수 없습니다. 확인일은 자료를 확인한 날이며, 오래된 평가의 실시일을 뜻하지 않습니다. 모델이 없는 항목은 미공개 결과를 0점으로 만든 것이 아닙니다.

Arena는 선호 평점, DocVQA는 ANLS, Needle-in-a-Haystack 원본 실험은 0–10 채점값입니다. 다른 표의 숫자를 서로 더하거나 평균 내지 마세요.

함께 볼 비교 서비스

아래 서비스는 여러 평가를 모아 보여줍니다. 독립적인 단일 시험 점수로 취급하지 않습니다.

BenchLM ↗ · 단일 점수보다 어떤 벤치마크가 어떤 작업을 보는지 함께 확인해야 합니다.

Vellum LLM Leaderboard ↗ · 품질뿐 아니라 가격, 속도, context, provider 안정성을 함께 봐야 합니다.