벤치마크 상세

SWE-bench Verified

실전 코딩 이슈 해결: 버그 수정, repo 단위 코드 변경, 코딩 에이전트 평가

공식 리더보드 보기 공식 SWE-bench 저장소의 Verified 리더보드 상위 5개 결과입니다. 점수는 모델 단독이 아니라 표시된 agent/system 설정을 포함합니다.

점수 그래프

왼쪽부터 높은 순서

실제 GitHub issue를 고치는 능력을 평가합니다. 사람이 검수한 500개 문제 subset입니다.

모델 자체 능력뿐 아니라 agent scaffold, tool 사용, test 실행 능력이 섞입니다.