벤치마크 · 2026.09.07 확인
작업에 맞는 모델을 비교하세요
모델을 고르는 기준은 작업마다 다릅니다. 같은 평가 안에서 점수와 실험 조건을 함께 비교하세요.
LiveBench
2026-06-25 release
SWE-bench Verified 500
SWE-bench Verified 500 · mini-SWE-agent 2.0.0
SWE-bench Multilingual 300
SWE-bench Multilingual 300 · mini-SWE-agent 2.0.0a0
Aider Polyglot
225-case polyglot leaderboard
Arena Text / LMArena
Text Overall · Style Control ON
Artificial Analysis Intelligence Index
v4.2 · 2026-09-04
GPQA Diamond
Artificial Analysis · GPQA Diamond
Humanity's Last Exam
AA · 2,158 text-only questions · May 2025 revision
TAU-bench / τ²-Bench Telecom
AA · τ²-Bench Telecom
MMMU-Pro
Artificial Analysis · MMMU-Pro
AA-LCR
AA-LCR v1.1 · September 2026
SciCode
SciCode v1.0.1 · Artificial Analysis
Terminal-Bench 4.0
Terminal-Bench 4.0 · official leaderboard
BFCL V4
BFCL V4 · f7cf735 · bfcl-eval 2025.12.17
LiveCodeBench
Code generation · 2024-08-01–2025-05-01
MMLU-Pro
TIGER-Lab public leaderboard · Overall
MMMU
MMMU validation · Overall
LongBench v2
LongBench v2 · Overall w/ CoT
AIME 2026
MathArena · AIME 2026
DocVQA
DocVQA · single-document VQA · official submissions
VibeEval
Vibe-Eval v1 · all split · archived public table
HELM Capabilities
HELM Capabilities v1.15.0 · Core Scenarios
Needle-in-a-Haystack
Original Claude 2.1 experiment · historical archive
숫자를 읽기 전에
평가 버전, 추론 강도, 도구와 에이전트 설정이 다르면 점수를 직접 비교할 수 없습니다. 확인일은 자료를 확인한 날이며, 오래된 평가의 실시일을 뜻하지 않습니다. 모델이 없는 항목은 미공개 결과를 0점으로 만든 것이 아닙니다.
Arena는 선호 평점, DocVQA는 ANLS, Needle-in-a-Haystack 원본 실험은 0–10 채점값입니다. 다른 표의 숫자를 서로 더하거나 평균 내지 마세요.
함께 볼 비교 서비스
아래 서비스는 여러 평가를 모아 보여줍니다. 독립적인 단일 시험 점수로 취급하지 않습니다.
BenchLM ↗ · 단일 점수보다 어떤 벤치마크가 어떤 작업을 보는지 함께 확인해야 합니다.
Vellum LLM Leaderboard ↗ · 품질뿐 아니라 가격, 속도, context, provider 안정성을 함께 봐야 합니다.