벤치마크 상세
LongBench v2
긴 문서의 근거를 따라 추론: 대형 문서 요약, 긴 회의록, 긴 코드베이스 분석
공식 리더보드 보기
공식 기본 정렬과 같은 CoT 열을 사용합니다. 모델별 공개 결과의 날짜와 문맥 길이를 보존했습니다. 공식 표에 없는 신모델 점수는 추정하지 않습니다.
모든 공개 결과
모델 검색 · 점수순확인 2026. 09. 07.LongBench v2 · Overall w/ CoT% overall accuracy with CoT
36개 결과원문 ↗
| 순서 | 모델 / 실행 구성 | 점수 | 평가 조건·근거 |
|---|---|---|---|
| 1 | Gemini-2.5-Pro Google | 63.3 | 2025-03-25 · 문맥 1M |
| 2 | Gemini-2.5-Flash Google | 62.1 | 2025-04-17 · 문맥 1M |
| 3 | Qwen3-235B-A22B-Thinking-2507Alibaba | 60.6 | 2025-07-25 · 문맥 256k |
| 4 | DeepSeek-R1 DeepSeek | 58.3 | 2025-01-20 · 문맥 128k |
| 5 | Qwen3-235B-A22B-Instruct-2507Alibaba | 58.3 | 2025-07-22 · 문맥 256k |
| 6 | o1-preview OpenAI | 57.7 | 2024-09-12 · 문맥 128k |
| 7 | DeepSeek-R1-0528 DeepSeek | 56.7 | 2025-05-28 · 문맥 128k |
| 8 | MiniMax-Text-01 MiniMax | 56.5 | 2025-01-15 · 문맥 4M |
| 9 | Gemini-2.0-Flash-Thinking Google | 56 | 2025-01-21 · 문맥 1M |
| 10 | Gemini-Exp-1206 Google | 52.5 | 2024-12-06 · 문맥 2M |
| 11 | GPT-4o OpenAI | 51.4 | 2024-11-20 · 문맥 128k |
| 12 | GPT-4o OpenAI | 51.2 | 2024-08-06 · 문맥 128k |
| 13 | Gemini-2.0-Flash Google | 51.1 | 2024-12-11 · 문맥 1M |
| 14 | GLM-4.5Z.ai & Tsinghua | 50.3 | 2025-07-28 · 문맥 128k |
| 15 | Qwen3-30B-A3B-Thinking-2507Alibaba | 50.1 | 2025-07-25 · 문맥 256k |
| 16 | Qwen3-235B-A22BAlibaba | 50.1 | 2025-04-29 · 문맥 128k |
| 17 | Qwen3-32BAlibaba | 49.2 | 2025-04-29 · 문맥 128k |
| 18 | QwQ-32BAlibaba | 48.9 | 2025-03-06 · 문맥 128k |
| 19 | GLM-4.5-AirZ.ai & Tsinghua | 48.6 | 2025-07-28 · 문맥 128k |
| 20 | Claude 3.5 Sonnet Anthropic | 46.7 | 2024-10-22 · 문맥 200k |
| 21 | GLM-4-Plus Z.ai & Tsinghua | 46.1 | 2024-10-11 · 문맥 128k |
| 22 | Kimi-K2-Instruct Moonshot AI | 44.3 | 2025-07-11 · 문맥 128k |
| 23 | Qwen2.5-72B Alibaba | 43.5 | 2024-09-19 · 문맥 128k |
| 24 | Qwen3-30B-A3BAlibaba | 42.5 | 2025-04-29 · 문맥 128k |
| 25 | Mistral Large 24.11 Mistral AI | 39.6 | 2024-11-24 · 문맥 128k |
| 26 | o1-mini OpenAI | 38.9 | 2024-09-12 · 문맥 128k |
| 27 | Llama 3.1 70B Meta | 36.2 | 2024-07-23 · 문맥 128k |
| 28 | Llama 3.3 70B Meta | 36.2 | 2024-12-06 · 문맥 128k |
| 29 | Qwen2.5-7B Alibaba | 35.6 | 2024-09-19 · 문맥 128k |
| 30 | Nemotron 70B Nvidia | 35.2 | 2024-10-15 · 문맥 128k |
| 31 | Mistral Large 2 Mistral AI | 33.6 | 2024-07-24 · 문맥 128k |
| 32 | GPT-4o mini OpenAI | 32.4 | 2024-07-18 · 문맥 128k |
| 33 | NExtLong 8BCAS | 32 | 2025-01-23 · 문맥 512k |
| 34 | Command R+ Cohere | 31.6 | 2024-08-30 · 문맥 128k |
| 35 | GLM-4-9B Z.ai & Tsinghua | 30.8 | 2024-06-05 · 문맥 128k |
| 36 | Llama 3.1 8B Meta | 30.4 | 2024-07-23 · 문맥 128k |
일치하는 모델이 없습니다. 검색어를 줄여 보세요.
공개된 숫자만 높은 순으로 표시합니다. 순서가 신뢰구간을 고려한 확정 순위는 아닙니다. 공식 기본 정렬과 같은 CoT 열을 사용합니다. 모델별 공개 결과의 날짜와 문맥 길이를 보존했습니다. 공식 표에 없는 신모델 점수는 추정하지 않습니다.
읽는 법
전체 벤치마크긴 문서, 긴 대화, 긴 코드 문맥을 얼마나 유지하는지 봅니다.
context length 숫자만 보지 말고, 긴 문맥에서 필요한 정보를 실제로 찾는지 봐야 합니다.