벤치마크 상세

SWE-bench Verified 500

동일 하네스 코딩 비교: 버그 수정, repo 단위 코드 변경, 코딩 에이전트 평가

공식 리더보드 보기 공식 Verified 리더보드에서 같은 mini-SWE-agent 버전으로 평가된 모델만 비교합니다. 모델과 하네스·도구 설정이 결합된 결과이며 일반 채팅 성능으로 해석하지 않습니다.

모든 공개 결과

모델 검색 · 점수순
확인 2026. 09. 11.SWE-bench Verified 500 · mini-SWE-agent 2.0.0% resolved
13개 결과원문 ↗
순서모델 / 실행 구성점수평가 조건·근거
1Claude 4.5 Opus (high)76.8mini-SWE-agent 2.0.0 · 2026-02-17
2Gemini 3 Flash (high)75.8mini-SWE-agent 2.0.0 · 2026-02-17
3MiniMax M2.5 (high)75.8mini-SWE-agent 2.0.0 · 2026-02-17
4Claude 4.6 Opus75.6mini-SWE-agent 2.0.0 · 2026-02-17
5GLM 5 (high)72.8mini-SWE-agent 2.0.0 · 2026-02-17
6GPT 5.2 (high)72.8mini-SWE-agent 2.0.0 · 2026-02-17
7GPT 5.2 Codex72.8mini-SWE-agent 2.0.0 · 2026-02-19
8Claude 4.5 Sonnet (high)71.4mini-SWE-agent 2.0.0 · 2026-02-17
9Kimi K2.5 (high)70.8mini-SWE-agent 2.0.0 · 2026-02-17
10DeepSeek V3.2 (high)70mini-SWE-agent 2.0.0 · 2026-02-17
11Gemini 3 Pro69.6mini-SWE-agent 2.0.0 · 2026-02-26
12Claude 4.5 Haiku (high)66.6mini-SWE-agent 2.0.0 · 2026-02-17
13GPT 5 mini56.2mini-SWE-agent 2.0.0 · 2026-02-17

공개된 숫자만 높은 순으로 표시합니다. 순서가 신뢰구간을 고려한 확정 순위는 아닙니다. 공식 Verified 리더보드에서 같은 mini-SWE-agent 버전으로 평가된 모델만 비교합니다. 모델과 하네스·도구 설정이 결합된 결과이며 일반 채팅 성능으로 해석하지 않습니다.

실제 GitHub issue를 고치는 능력을 평가합니다. 사람이 검수한 500개 문제 subset입니다.

모델 자체 능력뿐 아니라 agent scaffold, tool 사용, test 실행 능력이 섞입니다.