Document Classification on RVL-CDIP (test)
97.7AccuracyEAML_Tr-KLD_Reg
Evaluation Results
| Method | Links | |
|---|---|---|
| EAML_Tr-KLD_RegModality=Multi-modal2023.05 | 97.7 | |
| EAML_Tr-KLD_RegModality=Image2023.05 | 97.67 | |
| EAML_Tr-KLD_RegModality=Text2023.05 | 97.63 | |
| Cross-ModalModality=Multi-modal2023.05 | 97.05 | |
| ERNIE-Layout_largeVariant=Large2022.10 | 96.27 | |
| ERNIE-LayoutModality=T+L+I, Model size=Large2023.05 | 96.27 | |
| UDOP-DualModality=V+T+L2022.12 | 96.22 | |
| DocFormer_BASEuse OCR=true, # params=183M + OCR2022.03 | 96.2 | |
| DocFormer_BASE2022.02 | 96.17 | |
| DocFormerModel scale=base2022.10 | 96.17 | |
| DocFormer BaseModalities=V + T, #Param.=183M2023.03 | 96.17 | |
| DocFormer B aseModality=Vision + Language + Layout, Train Data=5M, #Params=183M2022.05 | 96.17 | |
| DocFormerModality=T+L+I, Model size=Base2023.05 | 96.17 | |
| DocFormer BaseModality=Vision + Text + Layout, Pretrain Data=5M2023.09 | 96.17 | |
| DocFormerCategory=Text-Based Methods, #Param=183M2024.12 | 96.17 | |
| DocFormer-base#param (M)=183, Input modalities=image + text + spatial2021.06 | 96.17 | |
| GraphDocResnetModality=Vision + Text + Layout, Pretrain Data=320k2023.09 | 96.1 | |
| StructuralLM_LARGEParams=355M2021.05 | 96.08 | |
| StructuralLM_largeVariant=Large2022.10 | 96.08 | |
| StructuralLM LargeModalities=T, #Param.=355M2023.03 | 96.08 | |
| StructuralLMlargeModality=Text+Layout2022.12 | 96.08 | |
| StructuralLMlargeModality=T+L2022.12 | 96.08 | |
| StructuralLMModality=T+L, Model size=Large2023.05 | 96.08 | |
| GraphDocModality=Vision + Text + Layout, Pretrain Data=320k2023.09 | 96.02 | |
| UDOPModality=Vision+Text+Layout2022.12 | 96 | |
| UDOPModality=V+T+L2022.12 | 96 | |
| LayoutLMv3 LargeModalities=V + T, #Param.=368M2023.03 | 95.93 | |
| LayoutLMv3largeModality=Vision+Text+Layout2022.12 | 95.93 | |
| LayoutLMv3largeModality=V+T+L2022.12 | 95.93 | |
| LayoutLMv3Modality=T+L+I, Model size=Large2023.05 | 95.93 | |
| ERNIE-LayoutModel scale=base2022.10 | 95.81 | |
| LILT[EN-R]_BASEtext_backbone=RoBERTa-base2022.02 | 95.68 | |
| LILTModality=Text+Layout2022.12 | 95.68 | |
| LILTModality=T+L2022.12 | 95.68 | |
| LiLTModality=T+L+I, Model size=Base2023.05 | 95.68 | |
| LiLT BaseModality=Text + Layout, Pretrain Data=11M2023.09 | 95.68 | |
| LayoutLMv2-large#param (M)=426, Input modalities=image + text + spatial2021.06 | 95.65 | |
| LayoutLMv2Size variant=Large, Parameters=426M2021.02 | 95.64 | |
| LayoutLMv2-LARGEInput=Multi-modal2020.12 | 95.64 | |
| LayoutLMv2-LargePretraining Source=IIT-CDIP, Pretraining #Data=11M, Pretraining Scale=Word, Pretraining Max #Words=512, Pretraining Modality=V+L, #Param.=426M2022.04 | 95.64 | |
| LayoutLMv2_largeVariant=Large2022.10 | 95.64 | |
| LayoutLMv2 LargeModalities=V + T, #Param.=426M2023.03 | 95.64 | |
| LayoutLMv2largeModality=Vision+Text+Layout2022.12 | 95.64 | |
| LayoutLMv2largeModality=V+T+L2022.12 | 95.64 | |
| Xu et al.2023.05 | 95.64 | |
| LayoutLMv2Modality=T+L+I, Model size=Large2023.05 | 95.64 | |
| LiLT[InfoXLM]_BASEtext_backbone=InfoXLM-base, multilingual=true2022.02 | 95.62 | |
| BROS_BASE2022.02 | 95.58 | |
| BROSModality=Text + Layout, Pretrain Data=11M2023.09 | 95.58 | |
| BROS-base#param (M)=139, Input modalities=text / (text + spatial)2021.06 | 95.58 | |
| TILTSize variant=Large, Parameters=780M2021.02 | 95.52 | |
| TILT-LargePretraining Source=RVL-CDIP+, Pretraining #Data=1.1M, Pretraining Scale=Word, Pretraining Max #Words=512, Pretraining Modality=V+L, #Param.=780M2022.04 | 95.52 | |
| TILT_largeVariant=Large2022.10 | 95.52 | |
| TILT LargeModalities=V + T, #Param.=780M2023.03 | 95.52 | |
| TILTlargeModality=Vision+Text+Layout2022.12 | 95.52 | |
| TILTlargeModality=V+T+L2022.12 | 95.52 | |
| TITLModality=T+L+I, Model size=Large2023.05 | 95.52 | |
| DocFormer_largeVariant=Large2022.10 | 95.5 | |
| DocFormerlargeModality=Vision+Text+Layout2022.12 | 95.5 | |
| DocFormerlargeModality=V+T+L2022.12 | 95.5 | |
| DocFormerModality=T+L+I, Model size=Large2023.05 | 95.5 | |
| DocFormer-large#param (M)=536, Input modalities=image + text + spatial2021.06 | 95.5 | |
| LayoutLMv3 B aseModality=Vision + Language + Layout, Train Data=11M, #Params=133M2022.05 | 95.44 | |
| LayoutLMv3Modality=T+L+I, Model size=Base2023.05 | 95.44 | |
| LayoutLMv3 BaseModality=Vision + Text + Layout, Pretrain Data=11M2023.09 | 95.44 | |
| LayoutLMv3Category=Text-Based Methods, #Param=133M2024.12 | 95.44 | |
| LayoutLMv2_BASEuse OCR=true, # params=200M + OCR2022.03 | 95.3 | |
| DonutOCR=false, #Params=143M, Time (ms)=7522021.11 | 95.3 | |
| DonutModality=Vision2022.12 | 95.3 | |
| DonutModality=V2022.12 | 95.3 | |
| LayoutLMv2Size variant=Base, Parameters=200M2021.02 | 95.25 | |
| TILTSize variant=Base, Parameters=230M2021.02 | 95.25 | |
| LayoutLMv2-BASEInput=Multi-modal2020.12 | 95.25 | |
| LayoutLMv2_BASE2022.02 | 95.25 | |
| LayoutLMv2-BasePretraining Source=IIT-CDIP, Pretraining #Data=11M, Pretraining Scale=Word, Pretraining Max #Words=512, Pretraining Modality=V+L, #Param.=200M2022.04 | 95.25 | |
| TILT-BasePretraining Source=RVL-CDIP+, Pretraining #Data=1.1M, Pretraining Scale=Word, Pretraining Max #Words=512, Pretraining Modality=V+L, #Param.=230M2022.04 | 95.25 | |
| LayoutLMv2OCR=true, #Params=200M + α†, Time (ms)=14892021.11 | 95.25 | |
| TILTModel scale=base2022.10 | 95.25 | |
| LayoutLMv2Model scale=base2022.10 | 95.25 | |
| TIL T B aseModality=Vision + Language + Layout, Train Data=1M, #Params=230M2022.05 | 95.25 | |
| LayoutLMv2 B aseModality=Vision + Language + Layout, Train Data=11M, #Params=200M2022.05 | 95.25 | |
| TITLModality=T+L+I, Model size=Base2023.05 | 95.25 | |
| LayoutLMv2Modality=T+L+I, Model size=Base2023.05 | 95.25 | |
| TILT BaseModality=Vision + Text + Layout, Pretrain Data=1M2023.09 | 95.25 | |
| LayoutLMv2 BaseModality=Vision + Text + Layout, Pretrain Data=11M2023.09 | 95.25 | |
| LayoutLMv2-base#param (M)=200, Input modalities=image + text + spatial2021.06 | 95.25 | |
| LayoutXLM_BASEmultilingual=true2022.02 | 95.21 | |
| UDoc*Pretraining Source=IIT-CDIP, Pretraining #Data=1M, Pretraining Scale=Region, Pretraining Max #Words=64x512, Pretraining Modality=V+L, #Param.=272M, OCR Engine=Google OCR2022.04 | 95.05 | |
| UDocModalities=V + T, #Param.=272M2023.03 | 95.05 | |
| UniDocModality=Vision+Text+Layout2022.12 | 95.05 | |
| UDocModality=V+T+L2022.12 | 95.05 | |
| UDocModality=Vision + Text + Layout, Pretrain Data=11M2023.09 | 95.05 | |
| StrucTexTv2 LargeModalities=V, #Param.=238M2023.03 | 94.62 | |
| Donutuse OCR=false, # params=156M2022.03 | 94.5 | |
| EAM LModality=Vision + Language, Train Data=320k2022.05 | 94.44 | |
| LayoutLM_LARGEParams=390M2021.05 | 94.43 | |
| LayoutLMSize variant=Large, Parameters=343M2021.02 | 94.43 | |
| LayoutLM-LARGEInput=w/ image2020.12 | 94.43 | |
| LayoutLM-LargePretraining Source=IIT-CDIP, Pretraining #Data=11M, Pretraining Scale=Word, Pretraining Max #Words=512, Pretraining Modality=L, #Param.=343M2022.04 | 94.43 | |
| LayoutLM_largeVariant=Large2022.10 | 94.43 |