벤치마크 상세

DocVQA

문서 이미지에서 답 찾기: PDF, 보고서, 매출표, 사업 문서 분석

공식 리더보드 보기 공식 제출 시스템의 ANLS를 100점 척도로 변환했습니다. 기본 모델만의 성능이 아닌 문서 처리 시스템 결과도 포함됩니다. ChartQA는 다른 데이터셋이므로 같은 점수로 합치지 않습니다.

모든 공개 결과

모델 검색 · 점수순
확인 2026. 09. 07.DocVQA · single-document VQA · official submissionsANLS × 100
163개 결과원문 ↗
순서모델 / 실행 구성점수평가 조건·근거
1ORCA97.292026-03-10
2NEXT-8B97.282026-01-02
3qwen3vl97.252025-09-23
4Seed-VL-1.596.912025-05-13
5Star_LLM96.712025-11-09
6qwen2-vl96.72024-07-11
7196.072025-11-26
8395.92025-12-16
9InternVL2-Pro (generalist)95.062024-06-30
10MiMo-VL-7B-RL95.012025-06-04
11VideoLLaMA3-7B94.942025-01-16
12LLaVA-One-Vision-1.5-8B-Instruct94.842025-09-16
13Snowflake Arctic-Extract 7B94.72025-09-30
14CATI-VLM-IoT94.482025-07-16
15094.352025-11-20
16test94.062025-04-03
17Molmo-72B93.512024-09-25
18CCK-KVQwen93.482025-08-11
19Qwen2.5-3B-lite93.422025-02-26
20DeepSeek-VL293.32024-12-13
21qwenvl-max (single generalist model)93.072024-01-24
22Master Thesis92.982026-04-11
23Zamba2-VL-7B92.872026-05-22
24ZAYA1-VL-8B92.512026-03-18
25CATI-VLM92.422025-10-22
26Vary (using multi crop)92.412024-05-10
27InternVL-1.5-Plus (generalist)92.342024-04-27
28MLCD-Embodied-7B: Multi-label Cluster Discrimination for Visual Representation Learning91.582024-11-01
29qwenvl-plus (single generalist model)91.412023-12-07
30Zamba2-VL-2.7B90.922026-05-22
31granite-vision-3.3-2b90.872025-06-15
32SMoLA-PaLI-X Specialist Model90.842023-11-15
33PP-DocBee-2B90.562025-01-08
34SMoLA-PaLI-X Generalist Model90.552023-12-07
35Snowflake Arctic-TILT 0.8B (fine-tuned)90.22024-05-01
36BAIDU-DI90.162022-10-08
37InternLM-XComposer2-4KHD-7B90.022024-04-02
38ScreenAI 5B89.882024-02-10
39Snowflake Arctic-TILT 0.8B (zero-shot)88.812024-05-01
40Tencent Youtu88.662022-03-31
41ERNIE-Layout 2.088.412022-01-13
42DocFormerv2 (Single Model with 750M Parameters)87.842023-12-10
43BlueLM-V-3B87.752024-10-30
44neetolab-sota-v187.592024-09-08
45Mybank-DocReader87.552021-11-26
46ERNIE-Layout 1.087.532021-09-06
47Zamba2-VL-1.2B87.432026-05-22
48Mini-Monkey87.382024-08-22
49GPT-4 Vision Turbo + Amazon Textract OCR87.362024-05-31
50Applica.ai TILT87.052021-02-12
51PaLI-X (Google Research; Single Generative Model)86.792023-05-31
52table-r1_qx86.722025-06-25
53LayoutLM 2.0 (single model)86.722020-12-22
54Qwen3.5_0.8B_test86.622026-03-08
5554_nnrc_zephyr85.62023-12-10
56Alibaba DAMO NLP85.062020-08-16
57PingAn-OneConnect-Gammalab-DQA84.842020-05-16
58PaliGemma-3B (finetune, 896px)84.772024-05-01
59Spatial LLM v1.284.432024-01-21
60LayoutLMv2_star_seg_large84.32023-02-21
61Vlm(qwen)84.112025-04-30
62MoVA-8B (generalist)83.412024-06-26
63LATIN-Prompt + Claude (Zero shot)83.362023-06-30
64llama3-qwenvit83.182024-10-09
65gemma+ocr82.822024-09-13
66DIVE-Doc (FRD)82.672025-07-12
6736_nnrc_llama282.392023-11-27
68Qwen2.5-VL_DocVQA_240982.32025-09-25
69nnrc_udop_224_6ds82.272024-01-11
70loixc-onestage82.212024-08-02
71loixc-vqa81.272024-07-26
72Vis(qwen)80.932025-04-30
73Docugami-Layout80.312023-05-06
74Vary79.162024-03-01
75llama79.022025-01-10
76LayoutLMV2-large on Textract78.732022-01-07
77LayoutLMv2_star_seg78.592023-01-29
78PaliGemma-3B (finetune, 448px)78.022024-05-21
79YoBerDaV2 Single-page77.492023-05-25
80Structural LM-v276.742020-05-14
81llama3-intern6b76.72024-10-09
82pix2struct-large76.562022-09-18
83Submission_ErnieLayout_base_finetuned_on_DocVQA_en_train_dev_textract_word_segments_ck-1400075.992022-12-28
84Gemma 2b + OCR75.172024-09-18
85DOLMA_multifinetuning74.582024-04-22
86instructblip74.292024-02-13
87Ivy-VL74.172025-01-22
88Ivy-VL-0174.172025-01-22
89QA_Base_MRC_274.152020-05-15
90tixc-vqa74.132024-07-31
91QA_Base_MRC_174.072020-05-15
92QA_Base_MRC_473.482020-05-15
93QA_Base_MRC_373.222020-05-15
940713ap +gpt4o(no v)73.092024-10-26
95VisFocus-Base72.852024-01-22
96QA_Base_MRC_572.742020-05-15
97Dolma multifinetuning 772.192024-05-22
98pix2struct-base72.132022-09-18
991010ap +gpt4o(no v)72.012024-10-26
100MiniCPM-V-271.872024-04-02
101LayoutLM-base+GNN69.842023-01-27
102Electra Large Squad69.612021-12-05
103YoBerDaV1 Multi-page69.042023-05-25
104HyperDQA_V468.932020-05-16
105HyperDQA_V367.692020-05-16
106GPT3.567.592023-07-06
107HyperDQA_V267.342020-05-16
108HyperDQA_V167.172020-05-09
109LATIN-Tuning-Prompt + Alpaca (Zero-shot)66.872023-08-15
110donut_base65.92023-07-14
111ViTLP65.882023-12-04
112DocVQA: A Dataset for VQA on Document Images65.662023-12-21
113BROS_BASE (WebViCoB 6.4M)65.632022-09-22
114Layoutlm_DocVQA+Token_v265.622023-09-24
115donut_half_input_imageSize65.362023-07-21
116Bert Large64.472021-12-04
117Dessurt63.222022-05-23
118dolma61.962024-01-09
119Vlm(llama)59.142025-04-30
120bert fulldata fintuned592020-05-09
121bert finetuned58.722020-05-01
122HyperDQA_V057.152020-04-30
123LayoutLM_Docvqa+Token_v049.82023-09-26
124LayoutLMv2, Tesseract OCR eval (dataset OCR trained)49.612022-04-27
125Vis(llama)49.192025-04-30
126LayoutLMv2, Tesseract OCR eval (Tesseract OCR trained)48.152022-03-29
127donut_large_encoderSize_finetuned_20_epoch46.732023-07-26
128bert45.572020-04-27
129UGLIFT v0.1 (Clova OCR)44.172020-05-16
130PaliGemma-3B (finetune, 224px)43.742024-05-21
131HocrEN(Technique 2) - qwen7b42.822025-04-30
132HocrEN(Technique 2) - qwen14b37.942025-04-30
133Finetuning LayoutLMv3_Base35.962022-10-21
134testtest35.692023-09-19
135Plain BERT QA35.242020-05-14
136Clova OCR V034.892020-05-16
137HDNet34.012020-05-01
138CLOVA OCR32.962020-05-16
139donut_small_encoderSize_finetuned_20_epoch31.572023-07-21
140docVQAQV_V0.130.162020-04-29
141HocrEN(Technique 2) - qwen32b29.312025-04-30
142m-rope226.762025-05-10
143HocrEN(Technique 2) - llama24.882025-04-30
144dsf24.312026-01-30
145docVQAQV_V023.422020-04-26
146HocrEN(Technique 2) - mistral18.32025-04-30
147gmini2517.142025-05-15
148doubao1515.852025-05-15
149claude3715.842025-05-15
150gpt4o15.412025-05-15
151wenxin4514.772025-05-15
152seq2seq10.812021-02-08
153lixiang-vlm-7b-handled9.92024-01-23
154lixiang-vlm-7b6.312024-01-24
155sg6.032025-09-15
156dfnb5.952025-09-15
157clipb5.882025-09-15
158dfnl5.852025-09-15
159lixiang-vlm handled5.362024-01-21
160lixiang-vlm2.642024-01-21
161Test Submission02020-06-16
162zs02024-09-11
163table-r102025-06-25

공개된 숫자만 높은 순으로 표시합니다. 순서가 신뢰구간을 고려한 확정 순위는 아닙니다. 공식 제출 시스템의 ANLS를 100점 척도로 변환했습니다. 기본 모델만의 성능이 아닌 문서 처리 시스템 결과도 포함됩니다. ChartQA는 다른 데이터셋이므로 같은 점수로 합치지 않습니다.

문서 이미지 질의응답의 ANLS를 평가합니다. ChartQA와는 별개의 평가입니다.

OCR와 문서 처리 파이프라인이 포함된 제출 시스템 점수도 있습니다. 기본 모델 능력과 동일시하지 않습니다.