Form Understanding on FUNSD (test)
92.08F1 ScoreLayoutLMv3_LARGE
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| LayoutLMv3_LARGEParameters=368M, Modality=T+L+I (P), Image Embedding=Linear2022.04 | 92.08 | — | — | — | — | — | |
| LayoutLMv3-largeModality=image + text + spatial, #param=368M2023.06 | 92.08 | 92.19 | 92.1 | — | — | — | |
| UDOPModality=image + text + spatial, #param=794M, OCR granularity=OCR lines2023.06 | 91.62 | — | — | — | — | — | |
| LayoutLMv3_BASEParameters=133M, Modality=T+L+I (P), Image Embedding=Linear2022.04 | 90.29 | — | — | — | — | — | |
| LayoutLMv3-baseModality=image + text + spatial, #param=133M2023.06 | 90.29 | 89.55 | 91.65 | — | — | — | |
| ERNIE-LayoutModel scale=base2022.10 | 90.28 | — | — | — | — | — | |
| DocFormerv2-largeModality=image + text + spatial, #param=750M2023.06 | 88.89 | 89.88 | 87.92 | — | — | — | |
| LiLT_BASEModality=T+L, Image Embedding=None2022.04 | 88.41 | — | — | — | — | — | |
| DocFormerv2-baseModality=image + text + spatial, #param=232M2023.06 | 88.37 | 89.15 | 87.6 | — | — | — | |
| UDocParameters=272M, Modality=T+L+I (R), Image Embedding=ResNet-502022.04 | 87.93 | — | — | — | — | — | |
| UDocModality=image + text + spatial, #param=272M2023.06 | 87.93 | — | — | — | — | — | |
| StructuralLM_LARGEParameters=355M2021.05 | 85.14 | 83.52 | 86.81 | — | — | — | |
| StructuralLM_LARGEParameters=355M, Modality=T+L, Image Embedding=None2022.04 | 85.14 | — | — | — | — | — | |
| StructuralLM-largeModality=text / spatial, #param=355M2023.06 | 85.14 | 83.52 | 86.81 | — | — | — | |
| FormNetParameters=217M, Modality=T+L, Image Embedding=None2022.04 | 84.69 | — | — | — | — | — | |
| FormNetModality=text / spatial, #param=217M2023.06 | 84.69 | 85.21 | 84.18 | — | — | — | |
| DocFormer_LARGEParameters=536M, Modality=T+L+I (G), Image Embedding=ResNet-502022.04 | 84.55 | — | — | — | — | — | |
| DocFormer-largeModality=image + text + spatial, #param=536M2023.06 | 84.55 | 82.29 | 86.94 | — | — | — | |
| BROS_LARGEParameters=340M, Modality=T+L, Image Embedding=None2022.04 | 84.52 | — | — | — | — | — | |
| LayoutLMv2_LARGEParameters=426M, Modality=T+L+I (G), Image Embedding=ResNeXt101-FPN2022.04 | 84.2 | — | — | — | — | — | |
| LayoutLMv2-largeModality=image + text + spatial, #param=426M2023.06 | 84.2 | 83.24 | 85.19 | — | — | — | |
| SelfDocModality=T+L+I (R), Image Embedding=ResNeXt-1012022.04 | 83.36 | — | — | — | — | — | |
| SelfDocModality=image + text + spatial2023.06 | 83.36 | — | — | — | — | — | |
| XYLayoutLM_BASEModality=T+L+I (G), Image Embedding=ResNeXt-1012022.04 | 83.35 | — | — | — | — | — | |
| DocFormer_BASEParameters=183M, Modality=T+L+I (G), Image Embedding=ResNet-502022.04 | 83.34 | — | — | — | — | — | |
| DocFormerModel scale=base2022.10 | 83.34 | — | — | — | — | — | |
| DocFormer-baseModality=image + text + spatial, #param=183M2023.06 | 83.34 | 80.76 | 86.09 | — | — | — | |
| StrucTexTModality=image + text + spatial, #param=107M, Standard Split=false2023.06 | 83.09 | 85.68 | 80.97 | — | — | — | |
| BROS_BASEParameters=110M, Modality=T+L, Image Embedding=None2022.04 | 83.05 | — | — | — | — | — | |
| LayoutLMv2_BASEParameters=200M, Modality=T+L+I (G), Image Embedding=ResNeXt101-FPN2022.04 | 82.76 | — | — | — | — | — | |
| LayoutLMv2Model scale=base2022.10 | 82.76 | — | — | — | — | — | |
| LayoutLMv2-baseModality=image + text + spatial, #param=200M2023.06 | 82.76 | 80.29 | 85.39 | — | — | — | |
| LayoutLMv3-largeModality=image + text + spatial, #param=368M, OCR granularity=word boxes2023.06 | 82.53 | 81.35 | 83.75 | — | — | — | |
| BROS2021.05 | 81.21 | 80.56 | 81.88 | — | — | — | |
| BROS-baseModality=text / spatial, #param=139M2023.06 | 81.21 | 80.56 | 81.88 | — | — | — | |
| LayoutLMv3-baseModality=image + text + spatial, #param=133M, OCR granularity=word boxes2023.06 | 79.46 | 77.39 | 81.65 | — | — | — | |
| LayoutLM_BASEModality=Text + Layout + Image, Pre-training Objectives=MVLM, Pre-training Data=11M, Pre-training Epochs=2 epochs, #Parameters=160M2019.12 | 79.27 | 76.77 | 81.95 | — | — | — | |
| LayoutLM_BASEParameters=160M, Modality=T+L+I (R), Image Embedding=ResNet-101 (fine-tune)2022.04 | 79.27 | — | — | — | — | — | |
| LayoutLMv1-baseModality=image + text + spatial, #param=160M2023.06 | 79.27 | 76.77 | 81.95 | — | — | — | |
| LayoutLM_LARGEParameters=343M2021.05 | 78.95 | 75.96 | 82.19 | — | — | — | |
| LayoutLM_BASEModality=Text + Layout, Pre-training Objectives=MVLM, Pre-training Data=11M, Pre-training Epochs=2 epochs, #Parameters=113M2019.12 | 78.66 | 75.97 | 81.55 | — | — | — | |
| LayoutLM_BASEParameters=113M2021.05 | 78.66 | 75.97 | 81.55 | — | — | — | |
| LayoutLMModel scale=base2022.10 | 78.66 | — | — | — | — | — | |
| LayoutLMv1-baseModality=text / spatial, #param=113M2023.06 | 78.66 | 76.12 | 81.55 | — | — | — | |
| LayoutLM_LARGEModality=Text + Layout, Pre-training Objectives=MVLM, Pre-training Data=11M, Pre-training Epochs=1 epoch, #Parameters=343M2019.12 | 77.89 | 75.36 | 80.6 | — | — | — | |
| LayoutLM_LARGEParameters=343M, Modality=T+L, Image Embedding=None2022.04 | 77.89 | — | — | — | — | — | |
| LayoutLMv1-largeModality=text / spatial, #param=343M2023.06 | 77.89 | 75.36 | 80.61 | — | — | — | |
| LayoutLM_BASEModality=Text + Layout, Pre-training Objectives=MVLM, Pre-training Data=2M, Pre-training Epochs=6 epochs, #Parameters=113M2019.12 | 75.92 | 73.77 | 78.2 | — | — | — | |
| LayoutLM_LARGEModality=Text + Layout, Pre-training Objectives=MVLM, Pre-training Data=1M, Pre-training Epochs=6 epochs, #Parameters=343M2019.12 | 75.85 | 71.71 | 80.5 | — | — | — | |
| LayoutLM_BASEModality=Text + Layout, Pre-training Objectives=MVLM+MDC, Pre-training Data=11M, Pre-training Epochs=1 epoch, #Parameters=113M2019.12 | 74.75 | 71.94 | 77.8 | — | — | — | |
| LayoutLM_BASEModality=Text + Layout + Image, Pre-training Objectives=MVLM, Pre-training Data=1M, Pre-training Epochs=6 epochs, #Parameters=160M2019.12 | 74.41 | 71.01 | 78.15 | — | — | — | |
| LayoutLM_BASEModality=Text + Layout, Pre-training Objectives=MVLM+MDC, Pre-training Data=1M, Pre-training Epochs=6 epochs, #Parameters=113M2019.12 | 73.72 | 70.76 | 76.95 | — | — | — | |
| LayoutLM_BASEModality=Text + Layout, Pre-training Objectives=MVLM, Pre-training Data=1M, Pre-training Epochs=6 epochs, #Parameters=113M2019.12 | 72.99 | 69.09 | 77.35 | — | — | — | |
| RoBERTa_LARGEModality=Text only, #Parameters=355M2019.12 | 70.72 | 67.8 | 73.91 | — | — | — | |
| RoBERTa_LARGEParameters=355M2021.05 | 70.72 | 67.8 | 73.91 | — | — | — | |
| RoBERTa_LARGEParameters=355M, Modality=T, Image Embedding=None2022.04 | 70.72 | — | — | — | — | — | |
| RoBERTa-largeModality=text / spatial, #param=355M2023.06 | 70.72 | 67.8 | 73.91 | — | — | — | |
| UniLMv2-largeModality=text / spatial, #param=355M2023.06 | 70.72 | 67.8 | 73.91 | — | — | — | |
| LayoutLM_BASEModality=Text + Layout, Pre-training Objectives=MVLM, Pre-training Data=500K, Pre-training Epochs=6 epochs, #Parameters=113M2019.12 | 69.85 | 66.5 | 73.55 | — | — | — | |
| RoBERTa_BASEModality=Text only, #Parameters=125M2019.12 | 66.48 | 63.49 | 69.75 | — | — | — | |
| RoBERTa_BASEParameters=125M2021.05 | 66.48 | 63.49 | 69.75 | — | — | — | |
| RoBERTa_BASEParameters=125M, Modality=T, Image Embedding=None2022.04 | 66.48 | — | — | — | — | — | |
| RoBERTa-baseModality=text / spatial, #param=125M2023.06 | 66.48 | 63.49 | 69.75 | — | — | — | |
| UniLMv2-baseModality=text / spatial, #param=125M2023.06 | 66.48 | 63.49 | 69.75 | — | — | — | |
| BERT_LARGEModality=Text only, #Parameters=340M2019.12 | 65.63 | 61.13 | 70.85 | — | — | — | |
| BERT_LARGEParameters=349M2021.05 | 65.63 | 61.13 | 70.85 | — | — | — | |
| BERT_LARGEParameters=340M, Modality=T, Image Embedding=None2022.04 | 65.63 | — | — | — | — | — | |
| BERT-largeModality=text / spatial, #param=340M2023.06 | 65.63 | 61.13 | 70.85 | — | — | — | |
| Dessurt-baseModality=image, #param=127M2023.06 | 65 | — | — | — | — | — | |
| BERT_BASEModality=Text only, #Parameters=110M2019.12 | 60.26 | 54.69 | 67.1 | — | — | — | |
| BERT_BASEParameters=110M2021.05 | 60.26 | 54.69 | 67.1 | — | — | — | |
| BERT_BASEParameters=110M, Modality=T, Image Embedding=None2022.04 | 60.26 | — | — | — | — | — | |
| BERT-baseModality=text / spatial, #param=109M2023.06 | 60.26 | 54.69 | 61.71 | — | — | — | |
| BROSBASEGT OCR used=boxes + text, # params=138M + OCR2022.03 | — | — | — | 83.1 | 71.5 | — | |
| DessurtGT OCR used=none, # params=127M2022.03 | — | — | — | 65 | 42.3 | 23.4 | |
| DocFormerBASEGT OCR used=boxes + text, # params=183M + OCR2022.03 | — | — | — | 83.3 | — | — | |
| FUDGE (+Tesseract)GT OCR used=none, # params=17M (+OCR)2022.03 | — | — | — | 66.5 | 56.6 | 34.8 | |
| LayoutLMBASEGT OCR used=boxes + text, # params=-2022.03 | — | — | — | 78.7 | 42.8 | — | |
| LayoutLMv2BASEGT OCR used=boxes + text, # params=200M + OCR2022.03 | — | — | — | 82.8 | — | — | |
| Word-FUDGEGT OCR used=boxes, # params=17M + OCR2022.03 | — | — | — | 72.2 | 62.6 | — |