벤치마크 상세

Terminal-Bench 4.0

터미널에서 실제 작업 완수: CLI 작업, repo 세팅, 데이터 처리, 시스템 작업 자동화

공식 리더보드 보기 4.0 결과만 모았습니다. 모델·에이전트·추론 강도를 함께 표기하고 공식 시행 수와 신뢰구간을 보존합니다. 2.0/2.1 점수와 직접 비교하지 않습니다.

모든 공개 결과

모델 검색 · 점수순
확인 2026. 09. 07.Terminal-Bench 4.0 · official leaderboard% resolution rate
18개 결과원문 ↗
순서모델 / 실행 구성점수평가 조건·근거
1GPT-6 Astra · Codex · maxOpenAI58.1895% 신뢰구간 ±2.79 · 330개 시행/문항 · 2026-09-03
2Fable 5.1 · Claude Code · maxAnthropic57.8895% 신뢰구간 ±3.76 · 330개 시행/문항 · 2026-09-01
3GPT-6 Astra · Codex · xhighOpenAI57.8895% 신뢰구간 ±2.72 · 330개 시행/문항 · 2026-09-03
4GPT-6 Astra · Codex · highOpenAI57.8895% 신뢰구간 ±2.97 · 330개 시행/문항 · 2026-09-03
5GPT-6 Astra · Codex · mediumOpenAI54.2495% 신뢰구간 ±2.66 · 330개 시행/문항 · 2026-09-03
6Opus 5 · Claude Code · maxAnthropic51.8295% 신뢰구간 ±3.39 · 330개 시행/문항 · 2026-07-24
7GPT-6 Astra · Codex · lowOpenAI50.6195% 신뢰구간 ±2.75 · 330개 시행/문항 · 2026-09-03
8Fable 5 · Claude Code · maxAnthropic44.5595% 신뢰구간 ±3.85 · 330개 시행/문항 · 2026-06-09
9GLM-5.3 · Claude Code · maxZ.ai41.8295% 신뢰구간 ±3.23 · 330개 시행/문항 · 2026-08-14
10GPT-5.6 Sol · Codex · maxOpenAI37.2795% 신뢰구간 ±3.78 · 330개 시행/문항 · 2026-06-26
11Opus 4.8 · Claude Code · maxAnthropic23.6495% 신뢰구간 ±3.56 · 330개 시행/문항 · 2026-05-28
12GPT-5.6 Terra · Codex · maxOpenAI21.5295% 신뢰구간 ±3.25 · 330개 시행/문항 · 2026-06-26
13Grok 4.6 · Grok Build · highxAI20.395% 신뢰구간 ±3.09 · 330개 시행/문항 · 2026-08-12
14Gemini 3.8 Flash · mini-SWE-agent · highGoogle19.0995% 신뢰구간 ±3.36 · 330개 시행/문항 · 2026-09-02
15GPT-5.6 Luna · Codex · maxOpenAI17.2795% 신뢰구간 ±2.85 · 330개 시행/문항 · 2026-06-26
16Grok 4.5 · Grok Build · highxAI12.4295% 신뢰구간 ±2.62 · 330개 시행/문항 · 2026-07-16
17Sonnet 5 · Claude Code · maxAnthropic12.4295% 신뢰구간 ±3.06 · 330개 시행/문항 · 2026-06-30
18Gemini 3.7 Flash · mini-SWE-agent · highGoogle11.2195% 신뢰구간 ±2.45 · 330개 시행/문항 · 2026-08-13

공개된 숫자만 높은 순으로 표시합니다. 순서가 신뢰구간을 고려한 확정 순위는 아닙니다. 4.0 결과만 모았습니다. 모델·에이전트·추론 강도를 함께 표기하고 공식 시행 수와 신뢰구간을 보존합니다. 2.0/2.1 점수와 직접 비교하지 않습니다.

터미널 환경에서 명령을 실행하며 문제를 해결하는 agent 능력을 봅니다.

코딩 에이전트가 실제 개발 환경에서 손발을 잘 쓰는지 보는 데 좋습니다.