Document Information Extraction on DeepForm (test)
80.061F1InternVL2-8B-CoB
Evaluation Results
| Method | Links | |
|---|---|---|
| InternVL2-8B-CoBDoc-CoB=true, Backbone=InternVL2-8B2025.05 | 80.061 | |
| DocOwl 1.5-CoBDoc-CoB=true, Backbone=DocOwl 1.52025.05 | 79.332 | |
| Qwen2.5-VL-CoBDoc-CoB=true, Backbone=Qwen2.5-VL2025.05 | 79.2 | |
| InternVL2-2B-CoBDoc-CoB=true, Backbone=InternVL2-2B2025.05 | 78.57 | |
| DocOwl 1.5-RReasoning tasks=true, Backbone=DocOwl 1.52025.05 | 77.86 | |
| DocOwl 1.5*SFT baseline=true, Backbone=DocOwl 1.52025.05 | 74.98 | |
| DonutModel Params=143M, Trainable Params=143M, Pre-training Data=13M, Fine-tuning Data=Task-specific2024.11 | 61.6 | |
| mPLUG-Owl-7B + OursModel Params=7.2B, Trainable Params=96M, Pre-training Data=1.1B, Fine-tuning Data=650K2024.11 | 53 | |
| mPLUG-Owl-7B + UReaderModel Params=7.2B, Trainable Params=86M, Pre-training Data=1.1B, Fine-tuning Data=650K2024.11 | 49.5 | |
| InternVL2-2B-RReasoning tasks=true, Backbone=InternVL2-2B2025.05 | 48.49 | |
| InternVL2-8B-RReasoning tasks=true, Backbone=InternVL2-8B2025.05 | 48.49 | |
| Visual CoTMethod Class=Visual Prompting Methods2025.05 | 44.76 | |
| GPT-4oSize=Much Larger2025.05 | 44.75 | |
| InternVL2-40BSize=Much Larger2025.05 | 43.71 | |
| TextCoTMethod Class=Visual Prompting Methods2025.05 | 42.45 | |
| Qwen2.5-VL-RReasoning tasks=true, Backbone=Qwen2.5-VL2025.05 | 42.11 | |
| MonkeyModel Params=9.8B, Trainable Params=207M, Pre-training Data=1.4B+76.8M, Fine-tuning Data=1.44M2024.11 | 40.6 | |
| Qwen2.5-VL*SFT baseline=true, Backbone=Qwen2.5-VL2025.05 | 38.2 | |
| InternVL2-8B*SFT baseline=true, Backbone=InternVL2-8B2025.05 | 36.33 | |
| InternVL2-2B*SFT baseline=true, Backbone=InternVL2-2B2025.05 | 34.15 | |
| BLIP-2-OPT-2.7B + OursModel Params=3.8B, Trainable Params=14M, Pre-training Data=129M, Fine-tuning Data=650K2024.11 | 14.6 | |
| BLIP-2-OPT-2.7B + UReaderModel Params=3.8B, Trainable Params=8M, Pre-training Data=129M, Fine-tuning Data=650K2024.11 | 5.6 |