벤치마크 상세
SWE-bench Multilingual 300
다언어 저장소 이슈 해결: TypeScript, Java, Go 등 다양한 코드베이스를 다루는 에이전트
공식 리더보드 보기
공식 multilingual 리더보드에서 같은 mini-SWE-agent 버전으로 평가된 모델만 비교합니다. 모델과 하네스·도구 설정이 결합된 결과이며 일반 채팅 성능으로 해석하지 않습니다.
모든 공개 결과
모델 검색 · 점수순확인 2026. 09. 11.SWE-bench Multilingual 300 · mini-SWE-agent 2.0.0a0% resolved
12개 결과원문 ↗
| 순서 | 모델 / 실행 구성 | 점수 | 평가 조건·근거 |
|---|---|---|---|
| 1 | Gemini 3 Flash | 72.7 | mini-SWE-agent 2.0.0a0 · 2026-02-13 |
| 2 | Claude 4.6 Opus | 72 | mini-SWE-agent 2.0.0a0 · 2026-02-13 |
| 3 | Claude 4.5 Opus | 70.7 | mini-SWE-agent 2.0.0a0 · 2026-02-13 |
| 4 | GLM 5 | 69.7 | mini-SWE-agent 2.0.0a0 · 2026-02-13 |
| 5 | Gemini 3 Pro | 68.7 | mini-SWE-agent 2.0.0a0 · 2026-02-13 |
| 6 | MiniMax M2.5 | 68.3 | mini-SWE-agent 2.0.0a0 · 2026-02-16 |
| 7 | Kimi K2.5 | 67.3 | mini-SWE-agent 2.0.0a0 · 2026-02-13 |
| 8 | Claude 4.5 Sonnet | 67 | mini-SWE-agent 2.0.0a0 · 2026-02-13 |
| 9 | GPT 5.2 (high) | 66.7 | mini-SWE-agent 2.0.0a0 · 2026-02-13 |
| 10 | Claude 4.5 Haiku | 64.7 | mini-SWE-agent 2.0.0a0 · 2026-02-13 |
| 11 | DeepSeek V3.2 | 59 | mini-SWE-agent 2.0.0a0 · 2026-02-13 |
| 12 | GPT 5 mini | 39.7 | mini-SWE-agent 2.0.0a0 · 2026-02-13 |
일치하는 모델이 없습니다. 검색어를 줄여 보세요.
공개된 숫자만 높은 순으로 표시합니다. 순서가 신뢰구간을 고려한 확정 순위는 아닙니다. 공식 multilingual 리더보드에서 같은 mini-SWE-agent 버전으로 평가된 모델만 비교합니다. 모델과 하네스·도구 설정이 결합된 결과이며 일반 채팅 성능으로 해석하지 않습니다.
읽는 법
전체 벤치마크Python 외 여러 언어와 framework에서 실제 issue 해결 능력을 봅니다.
한국 개발자에게는 실제 웹/앱 스택과 더 가까운 신호일 수 있습니다.