Document Image Classification on RVL-CDIP 1.0 (test)
96.17AccuracyDocFormer_BASE
Evaluation Results
| Method | Links | |
|---|---|---|
| DocFormer_BASEParameters=183M, Modality=T+L+I (G), Image Embedding=ResNet-502022.04 | 96.17 | |
| StructuralLM_LARGEParameters=355M, Modality=T+L, Image Embedding=None2022.04 | 96.08 | |
| LayoutLMv3_LARGEParameters=368M, Modality=T+L+I (P), Image Embedding=Linear2022.04 | 95.93 | |
| LiLT_BASEModality=T+L, Image Embedding=ResNeXt101-FPN2022.04 | 95.68 | |
| LayoutLMv2_LARGEParameters=426M, Modality=T+L+I (G), Image Embedding=ResNeXt101-FPN2022.04 | 95.64 | |
| TILT_LARGEParameters=780M, Modality=T+L+I (R), Image Embedding=U-Net2022.04 | 95.52 | |
| DocFormer_LARGEParameters=536M, Modality=T+L+I (G), Image Embedding=ResNet-502022.04 | 95.5 | |
| LayoutLMv3_BASEParameters=133M, Modality=T+L+I (P), Image Embedding=Linear2022.04 | 95.44 | |
| TILT_BASEParameters=230M, Modality=T+L+I (R), Image Embedding=U-Net2022.04 | 95.25 | |
| LayoutLMv2_BASEParameters=200M, Modality=T+L+I (G), Image Embedding=ResNeXt101-FPN2022.04 | 95.25 | |
| UDocParameters=272M, Modality=T+L+I (R), Image Embedding=ResNet-502022.04 | 95.05 | |
| LayoutLM_BASEParameters=160M, Modality=T+L+I (R), Image Embedding=ResNet-101 (fine-tune)2022.04 | 94.42 | |
| SelfDocModality=T+L+I (R), Image Embedding=ResNeXt-1012022.04 | 92.81 | |
| Stacked GeneralizationMeta-classifier=MLNN, Model Components=Stacking of holistic & region-based models, Transfer Learning=Inter and intra-domain weights transfer2018.01 | 92.21 | |
| LayoutLM_LARGEParameters=343M, Modality=T+L, Image Embedding=None2022.04 | 91.9 | |
| Intra-Domain Transfer LearningBackbone=VGG-16, Input=Full document images, Transfer Learning=Weights transfer from VGG-16 trained on ImageNet2018.01 | 91.11 | |
| Afzal et al.Ensemble Backbones=AlexNet, VGG-16, GoogLeNet and ResNet-50, Transfer Learning=Weights transfer2018.01 | 90.97 | |
| Tensmeyer et al.Backbone=AlexNet, Architecture=Spatial Pyramidal Pooling (SPP), Resolution=384 x 384, Aspect Ratio Preservation=true2018.01 | 90.94 | |
| Csurka et al.Backbone=GoogLeNet, Transfer Learning=ImageNet based transfer learning2018.01 | 90.7 | |
| RoBERTa_LARGEParameters=355M, Modality=T, Image Embedding=None2022.04 | 90.11 | |
| RoBERTa_BASEParameters=125M, Modality=T, Image Embedding=None2022.04 | 90.06 | |
| BERT_LARGEParameters=340M, Modality=T, Image Embedding=None2022.04 | 89.92 | |
| BERT_BASEParameters=110M, Modality=T, Image Embedding=None2022.04 | 89.81 | |
| Harley et al.Backbone=AlexNet, Approach=Document section-based models, Transfer Learning=Weight transfer from Alexnet, Ensemble=max voting2018.01 | 89.8 | |
| Tensmeyer et al.Backbone=AlexNet, Architecture=Spatial Pyramidal Pooling (SPP), Transfer Learning=None2018.01 | 89.31 |