벤치마크 상세
SWE-bench Verified 500
동일 하네스 코딩 비교: 버그 수정, repo 단위 코드 변경, 코딩 에이전트 평가
공식 리더보드 보기
공식 Verified 리더보드에서 같은 mini-SWE-agent 버전으로 평가된 모델만 비교합니다. 모델과 하네스·도구 설정이 결합된 결과이며 일반 채팅 성능으로 해석하지 않습니다.
모든 공개 결과
모델 검색 · 점수순확인 2026. 09. 11.SWE-bench Verified 500 · mini-SWE-agent 2.0.0% resolved
13개 결과원문 ↗
| 순서 | 모델 / 실행 구성 | 점수 | 평가 조건·근거 |
|---|---|---|---|
| 1 | Claude 4.5 Opus (high) | 76.8 | mini-SWE-agent 2.0.0 · 2026-02-17 |
| 2 | Gemini 3 Flash (high) | 75.8 | mini-SWE-agent 2.0.0 · 2026-02-17 |
| 3 | MiniMax M2.5 (high) | 75.8 | mini-SWE-agent 2.0.0 · 2026-02-17 |
| 4 | Claude 4.6 Opus | 75.6 | mini-SWE-agent 2.0.0 · 2026-02-17 |
| 5 | GLM 5 (high) | 72.8 | mini-SWE-agent 2.0.0 · 2026-02-17 |
| 6 | GPT 5.2 (high) | 72.8 | mini-SWE-agent 2.0.0 · 2026-02-17 |
| 7 | GPT 5.2 Codex | 72.8 | mini-SWE-agent 2.0.0 · 2026-02-19 |
| 8 | Claude 4.5 Sonnet (high) | 71.4 | mini-SWE-agent 2.0.0 · 2026-02-17 |
| 9 | Kimi K2.5 (high) | 70.8 | mini-SWE-agent 2.0.0 · 2026-02-17 |
| 10 | DeepSeek V3.2 (high) | 70 | mini-SWE-agent 2.0.0 · 2026-02-17 |
| 11 | Gemini 3 Pro | 69.6 | mini-SWE-agent 2.0.0 · 2026-02-26 |
| 12 | Claude 4.5 Haiku (high) | 66.6 | mini-SWE-agent 2.0.0 · 2026-02-17 |
| 13 | GPT 5 mini | 56.2 | mini-SWE-agent 2.0.0 · 2026-02-17 |
일치하는 모델이 없습니다. 검색어를 줄여 보세요.
공개된 숫자만 높은 순으로 표시합니다. 순서가 신뢰구간을 고려한 확정 순위는 아닙니다. 공식 Verified 리더보드에서 같은 mini-SWE-agent 버전으로 평가된 모델만 비교합니다. 모델과 하네스·도구 설정이 결합된 결과이며 일반 채팅 성능으로 해석하지 않습니다.
읽는 법
전체 벤치마크실제 GitHub issue를 고치는 능력을 평가합니다. 사람이 검수한 500개 문제 subset입니다.
모델 자체 능력뿐 아니라 agent scaffold, tool 사용, test 실행 능력이 섞입니다.