벤치마크 상세

LongBench v2

긴 문서의 근거를 따라 추론: 대형 문서 요약, 긴 회의록, 긴 코드베이스 분석

공식 리더보드 보기 공식 기본 정렬과 같은 CoT 열을 사용합니다. 모델별 공개 결과의 날짜와 문맥 길이를 보존했습니다. 공식 표에 없는 신모델 점수는 추정하지 않습니다.

모든 공개 결과

모델 검색 · 점수순
확인 2026. 09. 07.LongBench v2 · Overall w/ CoT% overall accuracy with CoT
36개 결과원문 ↗
순서모델 / 실행 구성점수평가 조건·근거
1Gemini-2.5-Pro Google63.32025-03-25 · 문맥 1M
2Gemini-2.5-Flash Google62.12025-04-17 · 문맥 1M
3Qwen3-235B-A22B-Thinking-2507Alibaba60.62025-07-25 · 문맥 256k
4DeepSeek-R1 DeepSeek58.32025-01-20 · 문맥 128k
5Qwen3-235B-A22B-Instruct-2507Alibaba58.32025-07-22 · 문맥 256k
6o1-preview OpenAI57.72024-09-12 · 문맥 128k
7DeepSeek-R1-0528 DeepSeek56.72025-05-28 · 문맥 128k
8MiniMax-Text-01 MiniMax56.52025-01-15 · 문맥 4M
9Gemini-2.0-Flash-Thinking Google562025-01-21 · 문맥 1M
10Gemini-Exp-1206 Google52.52024-12-06 · 문맥 2M
11GPT-4o OpenAI51.42024-11-20 · 문맥 128k
12GPT-4o OpenAI51.22024-08-06 · 문맥 128k
13Gemini-2.0-Flash Google51.12024-12-11 · 문맥 1M
14GLM-4.5Z.ai & Tsinghua50.32025-07-28 · 문맥 128k
15Qwen3-30B-A3B-Thinking-2507Alibaba50.12025-07-25 · 문맥 256k
16Qwen3-235B-A22BAlibaba50.12025-04-29 · 문맥 128k
17Qwen3-32BAlibaba49.22025-04-29 · 문맥 128k
18QwQ-32BAlibaba48.92025-03-06 · 문맥 128k
19GLM-4.5-AirZ.ai & Tsinghua48.62025-07-28 · 문맥 128k
20Claude 3.5 Sonnet Anthropic46.72024-10-22 · 문맥 200k
21GLM-4-Plus Z.ai & Tsinghua46.12024-10-11 · 문맥 128k
22Kimi-K2-Instruct Moonshot AI44.32025-07-11 · 문맥 128k
23Qwen2.5-72B Alibaba43.52024-09-19 · 문맥 128k
24Qwen3-30B-A3BAlibaba42.52025-04-29 · 문맥 128k
25Mistral Large 24.11 Mistral AI39.62024-11-24 · 문맥 128k
26o1-mini OpenAI38.92024-09-12 · 문맥 128k
27Llama 3.1 70B Meta36.22024-07-23 · 문맥 128k
28Llama 3.3 70B Meta36.22024-12-06 · 문맥 128k
29Qwen2.5-7B Alibaba35.62024-09-19 · 문맥 128k
30Nemotron 70B Nvidia35.22024-10-15 · 문맥 128k
31Mistral Large 2 Mistral AI33.62024-07-24 · 문맥 128k
32GPT-4o mini OpenAI32.42024-07-18 · 문맥 128k
33NExtLong 8BCAS322025-01-23 · 문맥 512k
34Command R+ Cohere31.62024-08-30 · 문맥 128k
35GLM-4-9B Z.ai & Tsinghua30.82024-06-05 · 문맥 128k
36Llama 3.1 8B Meta30.42024-07-23 · 문맥 128k

공개된 숫자만 높은 순으로 표시합니다. 순서가 신뢰구간을 고려한 확정 순위는 아닙니다. 공식 기본 정렬과 같은 CoT 열을 사용합니다. 모델별 공개 결과의 날짜와 문맥 길이를 보존했습니다. 공식 표에 없는 신모델 점수는 추정하지 않습니다.

긴 문서, 긴 대화, 긴 코드 문맥을 얼마나 유지하는지 봅니다.

context length 숫자만 보지 말고, 긴 문맥에서 필요한 정보를 실제로 찾는지 봐야 합니다.