벤치마크 상세

SWE-bench Multilingual 300

다언어 저장소 이슈 해결: TypeScript, Java, Go 등 다양한 코드베이스를 다루는 에이전트

공식 리더보드 보기 공식 multilingual 리더보드에서 같은 mini-SWE-agent 버전으로 평가된 모델만 비교합니다. 모델과 하네스·도구 설정이 결합된 결과이며 일반 채팅 성능으로 해석하지 않습니다.

모든 공개 결과

모델 검색 · 점수순
확인 2026. 09. 11.SWE-bench Multilingual 300 · mini-SWE-agent 2.0.0a0% resolved
12개 결과원문 ↗
순서모델 / 실행 구성점수평가 조건·근거
1Gemini 3 Flash72.7mini-SWE-agent 2.0.0a0 · 2026-02-13
2Claude 4.6 Opus72mini-SWE-agent 2.0.0a0 · 2026-02-13
3Claude 4.5 Opus70.7mini-SWE-agent 2.0.0a0 · 2026-02-13
4GLM 569.7mini-SWE-agent 2.0.0a0 · 2026-02-13
5Gemini 3 Pro68.7mini-SWE-agent 2.0.0a0 · 2026-02-13
6MiniMax M2.568.3mini-SWE-agent 2.0.0a0 · 2026-02-16
7Kimi K2.567.3mini-SWE-agent 2.0.0a0 · 2026-02-13
8Claude 4.5 Sonnet67mini-SWE-agent 2.0.0a0 · 2026-02-13
9GPT 5.2 (high)66.7mini-SWE-agent 2.0.0a0 · 2026-02-13
10Claude 4.5 Haiku64.7mini-SWE-agent 2.0.0a0 · 2026-02-13
11DeepSeek V3.259mini-SWE-agent 2.0.0a0 · 2026-02-13
12GPT 5 mini39.7mini-SWE-agent 2.0.0a0 · 2026-02-13

공개된 숫자만 높은 순으로 표시합니다. 순서가 신뢰구간을 고려한 확정 순위는 아닙니다. 공식 multilingual 리더보드에서 같은 mini-SWE-agent 버전으로 평가된 모델만 비교합니다. 모델과 하네스·도구 설정이 결합된 결과이며 일반 채팅 성능으로 해석하지 않습니다.

Python 외 여러 언어와 framework에서 실제 issue 해결 능력을 봅니다.

한국 개발자에게는 실제 웹/앱 스택과 더 가까운 신호일 수 있습니다.