벤치마크 상세
Terminal-Bench 4.0
터미널에서 실제 작업 완수: CLI 작업, repo 세팅, 데이터 처리, 시스템 작업 자동화
공식 리더보드 보기
4.0 결과만 모았습니다. 모델·에이전트·추론 강도를 함께 표기하고 공식 시행 수와 신뢰구간을 보존합니다. 2.0/2.1 점수와 직접 비교하지 않습니다.
모든 공개 결과
모델 검색 · 점수순확인 2026. 09. 07.Terminal-Bench 4.0 · official leaderboard% resolution rate
18개 결과원문 ↗
| 순서 | 모델 / 실행 구성 | 점수 | 평가 조건·근거 |
|---|---|---|---|
| 1 | GPT-6 Astra · Codex · maxOpenAI | 58.18 | 95% 신뢰구간 ±2.79 · 330개 시행/문항 · 2026-09-03 |
| 2 | Fable 5.1 · Claude Code · maxAnthropic | 57.88 | 95% 신뢰구간 ±3.76 · 330개 시행/문항 · 2026-09-01 |
| 3 | GPT-6 Astra · Codex · xhighOpenAI | 57.88 | 95% 신뢰구간 ±2.72 · 330개 시행/문항 · 2026-09-03 |
| 4 | GPT-6 Astra · Codex · highOpenAI | 57.88 | 95% 신뢰구간 ±2.97 · 330개 시행/문항 · 2026-09-03 |
| 5 | GPT-6 Astra · Codex · mediumOpenAI | 54.24 | 95% 신뢰구간 ±2.66 · 330개 시행/문항 · 2026-09-03 |
| 6 | Opus 5 · Claude Code · maxAnthropic | 51.82 | 95% 신뢰구간 ±3.39 · 330개 시행/문항 · 2026-07-24 |
| 7 | GPT-6 Astra · Codex · lowOpenAI | 50.61 | 95% 신뢰구간 ±2.75 · 330개 시행/문항 · 2026-09-03 |
| 8 | Fable 5 · Claude Code · maxAnthropic | 44.55 | 95% 신뢰구간 ±3.85 · 330개 시행/문항 · 2026-06-09 |
| 9 | GLM-5.3 · Claude Code · maxZ.ai | 41.82 | 95% 신뢰구간 ±3.23 · 330개 시행/문항 · 2026-08-14 |
| 10 | GPT-5.6 Sol · Codex · maxOpenAI | 37.27 | 95% 신뢰구간 ±3.78 · 330개 시행/문항 · 2026-06-26 |
| 11 | Opus 4.8 · Claude Code · maxAnthropic | 23.64 | 95% 신뢰구간 ±3.56 · 330개 시행/문항 · 2026-05-28 |
| 12 | GPT-5.6 Terra · Codex · maxOpenAI | 21.52 | 95% 신뢰구간 ±3.25 · 330개 시행/문항 · 2026-06-26 |
| 13 | Grok 4.6 · Grok Build · highxAI | 20.3 | 95% 신뢰구간 ±3.09 · 330개 시행/문항 · 2026-08-12 |
| 14 | Gemini 3.8 Flash · mini-SWE-agent · highGoogle | 19.09 | 95% 신뢰구간 ±3.36 · 330개 시행/문항 · 2026-09-02 |
| 15 | GPT-5.6 Luna · Codex · maxOpenAI | 17.27 | 95% 신뢰구간 ±2.85 · 330개 시행/문항 · 2026-06-26 |
| 16 | Grok 4.5 · Grok Build · highxAI | 12.42 | 95% 신뢰구간 ±2.62 · 330개 시행/문항 · 2026-07-16 |
| 17 | Sonnet 5 · Claude Code · maxAnthropic | 12.42 | 95% 신뢰구간 ±3.06 · 330개 시행/문항 · 2026-06-30 |
| 18 | Gemini 3.7 Flash · mini-SWE-agent · highGoogle | 11.21 | 95% 신뢰구간 ±2.45 · 330개 시행/문항 · 2026-08-13 |
일치하는 모델이 없습니다. 검색어를 줄여 보세요.
공개된 숫자만 높은 순으로 표시합니다. 순서가 신뢰구간을 고려한 확정 순위는 아닙니다. 4.0 결과만 모았습니다. 모델·에이전트·추론 강도를 함께 표기하고 공식 시행 수와 신뢰구간을 보존합니다. 2.0/2.1 점수와 직접 비교하지 않습니다.
읽는 법
전체 벤치마크터미널 환경에서 명령을 실행하며 문제를 해결하는 agent 능력을 봅니다.
코딩 에이전트가 실제 개발 환경에서 손발을 잘 쓰는지 보는 데 좋습니다.