벤치마크 상세

Aider Polyglot

기존 코드 편집 성공률: 터미널 pair programming, 기존 코드 수정, PR 단위 변경

공식 리더보드 보기 모델 단독 점수가 아니라 Aider 버전, 명령, 편집 형식이 결합된 결과입니다. 같은 모델도 실행 구성에 따라 별도 행으로 나타날 수 있습니다.

모든 공개 결과

모델 검색 · 점수순
확인 2026. 09. 11.225-case polyglot leaderboardpass rate 2 (%)
69개 결과원문 ↗
순서모델 / 실행 구성점수평가 조건·근거
1gpt-5 (high) · diff88225개 시행/문항 · 2025-08-23
2gpt-5 (medium) · diff86.7225개 시행/문항 · 2025-08-25
3o3-pro (high) · diff84.9225개 시행/문항 · 2025-06-28
4gemini-2.5-pro-preview-06-05 (32k think) · diff-fenced83.1225개 시행/문항 · 2025-06-06
5o3 (high) · diff81.3225개 시행/문항 · 2025-06-25
6gpt-5 (low) · diff81.3225개 시행/문항 · 2025-08-25
7grok-4 (high) · diff79.6225개 시행/문항 · 2025-07-11
8gemini-2.5-pro-preview-06-05 (default think) · diff-fenced79.1225개 시행/문항 · 2025-06-06
9o3 (high) + gpt-4.1 · architect78.2224개 시행/문항 · 2025-06-27
10Gemini 2.5 Pro Preview 05-06 · diff-fenced76.9225개 시행/문항 · 2025-05-07
11o3 · diff76.9225개 시행/문항 · 2025-06-25
12DeepSeek-V3.2-Exp (Reasoner) · diff74.2225개 시행/문항 · 2025-10-03
13Gemini 2.5 Pro Preview 03-25 · diff-fenced72.9225개 시행/문항 · 2025-04-12
14o4-mini (high) · diff72225개 시행/문항 · 2025-04-16
15claude-opus-4-20250514 (32k thinking) · diff72225개 시행/문항 · 2025-05-25
16DeepSeek R1 (0528) · diff71.4224개 시행/문항 · 2025-06-06
17claude-opus-4-20250514 (no think) · diff70.7225개 시행/문항 · 2025-05-25
18DeepSeek-V3.2-Exp (Chat) · diff70.2225개 시행/문항 · 2025-10-03
19claude-3-7-sonnet-20250219 (32k thinking tokens) · diff64.9225개 시행/문항 · 2025-02-24
20DeepSeek R1 + claude-3-5-sonnet-20241022 · architect64225개 시행/문항 · 2025-01-23
21o1-2024-12-17 (high) · diff61.7224개 시행/문항 · 2024-12-21
22claude-sonnet-4-20250514 (32k thinking) · diff61.3225개 시행/문항 · 2025-05-24
23o3-mini (high) · diff60.4224개 시행/문항 · 2025-01-31
24claude-3-7-sonnet-20250219 (no thinking) · diff60.4225개 시행/문항 · 2025-02-24
25Qwen3 235B A22B diff, no think, Alibaba API · diff59.6225개 시행/문항 · 2025-05-09
26Kimi K2 · diff59.1225개 시행/문항 · 2025-07-17
27DeepSeek R1 · diff56.9225개 시행/문항 · 2025-01-20
28claude-sonnet-4-20250514 (no thinking) · diff56.4225개 시행/문항 · 2025-05-24
29DeepSeek V3 (0324) · diff55.1225개 시행/문항 · 2025-03-24
30gemini-2.5-flash-preview-05-20 (24k think) · diff55.1225개 시행/문항 · 2025-05-25
31Quasar Alpha · diff54.7225개 시행/문항 · 2025-04-04
32o3-mini (medium) · diff53.8225개 시행/문항 · 2025-01-31
33Grok 3 Beta · diff53.3225개 시행/문항 · 2025-04-10
34Optimus Alpha · diff52.9225개 시행/문항 · 2025-04-10
35gpt-4.1 · diff52.4225개 시행/문항 · 2025-04-14
36claude-3-5-sonnet-20241022 · diff51.6225개 시행/문항 · 2025-01-17
37Grok 3 Mini Beta (high) · whole49.3225개 시행/문항 · 2025-04-10
38DeepSeek Chat V3 (prev) · diff48.4225개 시행/문항 · 2024-12-25
39gemini-2.5-flash-preview-04-17 (default) · diff47.1225개 시행/문항 · 2025-04-20
40chatgpt-4o-latest (2025-03-29) · diff45.3225개 시행/문항 · 2025-03-29
41gpt-4.5-preview · diff44.9224개 시행/문항 · 2025-02-27
42gemini-2.5-flash-preview-05-20 (no think) · diff44225개 시행/문항 · 2025-05-26
43gpt-oss-120b (high) · diff41.8225개 시행/문항 · 2025-08-06
44Qwen3 32B · diff40225개 시행/문항 · 2025-05-08
45gemini-exp-1206 · whole38.2225개 시행/문항 · 2024-12-22
46Gemini 2.0 Pro exp-02-05 · whole35.6225개 시행/문항 · 2025-02-25
47Grok 3 Mini Beta (low) · whole34.7225개 시행/문항 · 2025-04-10
48o1-mini-2024-09-12 · whole32.9225개 시행/문항 · 2024-12-22
49gpt-4.1-mini · diff32.4225개 시행/문항 · 2025-04-14
50claude-3-5-haiku-20241022 · diff28225개 시행/문항 · 2024-12-21
51chatgpt-4o-latest (2025-02-15) · diff27.1223개 시행/문항 · 2025-02-15
52QwQ-32B + Qwen 2.5 Coder Instruct · architect26.2225개 시행/문항 · 2025-03-07
53gpt-4o-2024-08-06 · diff23.1225개 시행/문항 · 2024-12-30
54gemini-2.0-flash-exp · whole22.2225개 시행/문항 · 2024-12-22
55qwen-max-2025-01-25 · diff21.8225개 시행/문항 · 2025-01-28
56QwQ-32B · diff20.9225개 시행/문항 · 2025-03-06
57gpt-4o-2024-11-20 · diff18.2225개 시행/문항 · 2024-12-30
58gemini-2.0-flash-thinking-exp-01-21 · diff18.2225개 시행/문항 · 2025-01-21
59DeepSeek Chat V2.5 · diff17.8225개 시행/문항 · 2024-12-21
60Qwen2.5-Coder-32B-Instruct · whole16.4225개 시행/문항 · 2024-12-26
61Llama 4 Maverick · whole15.6225개 시행/문항 · 2025-04-06
62yi-lightning · whole12.9225개 시행/문항 · 2024-12-23
63command-a-03-2025-quality · whole12225개 시행/문항 · 2025-03-14
64Codestral 25.01 · whole11.1225개 시행/문항 · 2025-01-13
65openhands-lm-32b-v0.1 · whole10.2225개 시행/문항 · 2025-04-19
66gpt-4.1-nano · whole8.9225개 시행/문항 · 2025-04-14
67Qwen2.5-Coder-32B-Instruct · diff8225개 시행/문항 · 2024-12-22
68gemma-3-27b-it · whole4.9225개 시행/문항 · 2025-03-15
69gpt-4o-mini-2024-07-18 · whole3.6225개 시행/문항 · 2024-12-21

공개된 숫자만 높은 순으로 표시합니다. 순서가 신뢰구간을 고려한 확정 순위는 아닙니다. 모델 단독 점수가 아니라 Aider 버전, 명령, 편집 형식이 결합된 결과입니다. 같은 모델도 실행 구성에 따라 별도 행으로 나타날 수 있습니다.

여러 프로그래밍 언어에서 기존 파일을 직접 수정하는 능력을 봅니다.

코드를 새로 쓰는 능력보다 ‘이미 있는 코드를 제대로 고치는지’를 볼 때 유용합니다.