벤치마크 상세

LiveCodeBench

최근 알고리즘 문제 풀이: 알고리즘 문제 풀이, 코드 생성, 디버깅형 coding reasoning

공식 리더보드 보기 공식 기본 날짜 창과 동일하게 문항별 pass@1을 평균했습니다. 모델 출시가 평가 창 시작 이후이면 오염 가능성을 표시합니다. 결과가 없는 모델을 0점으로 만들지 않습니다.

모든 공개 결과

모델 검색 · 점수순
확인 2026. 09. 07.Code generation · 2024-08-01–2025-05-01% pass@1
28개 결과원문 ↗
순서모델 / 실행 구성점수평가 조건·근거
1O4-Mini (High)80.18454개 시행/문항
2O3 (High)75.77454개 시행/문항
3O4-Mini (Medium)74.23454개 시행/문항
4Gemini-2.5-Pro-06-0573.57454개 시행/문항
5DeepSeek-R1-052873.06454개 시행/문항
6Gemini-2.5-Pro-05-0671.81454개 시행/문항
7EXAONE-4.0-32B70.04454개 시행/문항
8OpenReasoning-Nemotron-32B69.8454개 시행/문항
9O3-Mini-2025-01-31 (High)67.4454개 시행/문항
10OpenCodeReasoning-Nemotron-1.1-32B66.83454개 시행/문항
11Grok-3-Mini (High)66.74454개 시행/문항
12O4-Mini (Low)65.86454개 시행/문항
13Qwen3-235B-A22B65.86454개 시행/문항
14XBai-o4-medium64.98454개 시행/문항
15O3-Mini-2025-01-31 (Med)63454개 시행/문항
16Gemini-2.5-Flash-05-2061.89454개 시행/문항
17Gemini-2.5-Flash-04-1760.57454개 시행/문항
18O3-Mini-2025-01-31 (Low)57.05454개 시행/문항
19Claude-Opus-4 (Thinking)56.61454개 시행/문항
20Claude-Sonnet-4 (Thinking)55.95454개 시행/문항
21Claude-Sonnet-447.14454개 시행/문항
22Claude-Opus-446.92454개 시행/문항
23Claude-3.5-Sonnet-2024102236.39454개 시행/문항
24GPT-4O-2024-08-0629.54454개 시행/문항
25GPT-4-Turbo-2024-04-0928.7454개 시행/문항
26GPT-4O-mini-2024-07-1827.47454개 시행/문항
27DeepSeek-V327.2454개 시행/문항
28Claude-3-Haiku20.22454개 시행/문항

공개된 숫자만 높은 순으로 표시합니다. 순서가 신뢰구간을 고려한 확정 순위는 아닙니다. 공식 기본 날짜 창과 동일하게 문항별 pass@1을 평균했습니다. 모델 출시가 평가 창 시작 이후이면 오염 가능성을 표시합니다. 결과가 없는 모델을 0점으로 만들지 않습니다.

새 코딩 문제를 계속 추가해 benchmark 오염을 줄입니다.

실제 앱 개발보다는 문제풀이형 코딩에 강한 모델을 보는 지표입니다.