벤치마크 상세
SWE-bench Verified
실전 코딩 이슈 해결: 버그 수정, repo 단위 코드 변경, 코딩 에이전트 평가
공식 리더보드 보기
공식 SWE-bench 저장소의 Verified 리더보드 상위 5개 결과입니다. 점수는 모델 단독이 아니라 표시된 agent/system 설정을 포함합니다.
점수 그래프
왼쪽부터 높은 순서읽는 법
전체 벤치마크실제 GitHub issue를 고치는 능력을 평가합니다. 사람이 검수한 500개 문제 subset입니다.
모델 자체 능력뿐 아니라 agent scaffold, tool 사용, test 실행 능력이 섞입니다.