Scene Text Recognition on CUTE
96.5AccuracyDiG (ViT-B)
Evaluation Results
| Method | Links | |
|---|---|---|
| DiG (ViT-B)VP (Visual Pre-training)=true, LP (Language Pre-training)=false, AD (Annotated Data)=real, #Params=52M2022.06 | 96.5 | |
| DiG (ViT-S)VP (Visual Pre-training)=true, LP (Language Pre-training)=false, AD (Annotated Data)=real, #Params=36M2022.06 | 96.2 | |
| MaskOCR (ViT-S)VP (Visual Pre-training)=true, LP (Language Pre-training)=true, AD (Annotated Data)=real, #Params=31M2022.06 | 96.2 | |
| MaskOCR (ViT-B)VP (Visual Pre-training)=true, LP (Language Pre-training)=true, AD (Annotated Data)=real, #Params=97M2022.06 | 95.8 | |
| VSTLanguage Mode=Lan-aware2022.04 | 95.1 | |
| SVTR-LBackbone=Large2022.04 | 95.1 | |
| ABINet-LVestLabeled Datasets=MJ+ST, Unlabeled Datasets=Uber-Text2021.03 | 94.1 | |
| ABINet-LVstLabeled Datasets=MJ+ST, Unlabeled Datasets=Uber-Text2021.03 | 93.4 | |
| I2C2WVP (Visual Pre-training)=false, LP (Language Pre-training)=false, AD (Annotated Data)=synth2022.06 | 93.1 | |
| SVTR-SBackbone=Small2022.04 | 92 | |
| VST*Language Mode=Lan-free2022.04 | 91.8 | |
| PREN2DLanguage Mode=Lan-aware2022.04 | 91.7 | |
| SVTR-BBackbone=Base2022.04 | 91.7 | |
| ConCLRVP (Visual Pre-training)=false, LP (Language Pre-training)=true, AD (Annotated Data)=synth, #Params=37M2022.06 | 91.3 | |
| DiG (ViT-B)VP (Visual Pre-training)=true, LP (Language Pre-training)=false, AD (Annotated Data)=synth, #Params=52M2022.06 | 91.3 | |
| MaskOCR (ViT-B)VP (Visual Pre-training)=false, LP (Language Pre-training)=false, AD (Annotated Data)=synth, #Params=97M2022.06 | 90.6 | |
| RobustScannerLabeled Datasets=MJ+ST2021.03 | 90.3 | |
| MaskOCR (ViT-B)VP (Visual Pre-training)=true, LP (Language Pre-training)=true, AD (Annotated Data)=synth, #Params=97M2022.06 | 90.3 | |
| PerSecVP (Visual Pre-training)=true, LP (Language Pre-training)=false, AD (Annotated Data)=synth2022.06 | 90.2 | |
| TrOCRVP (Visual Pre-training)=true, LP (Language Pre-training)=true, AD (Annotated Data)=synth, #Params=558M2022.06 | 89.6 | |
| ABINet-LVLabeled Datasets=MJ+ST2021.03 | 89.2 | |
| ABINetLanguage Mode=Lan-aware2022.04 | 89.2 | |
| ABINetVP (Visual Pre-training)=false, LP (Language Pre-training)=true, AD (Annotated Data)=synth, #Params=37M2022.06 | 89.2 | |
| MaskOCR (ViT-S)VP (Visual Pre-training)=true, LP (Language Pre-training)=true, AD (Annotated Data)=synth, #Params=31M2022.06 | 89.2 | |
| ABINet-SVLabeled Datasets=MJ+ST2021.03 | 88.9 | |
| VisionLANLanguage Mode=Lan-aware2022.04 | 88.5 | |
| VisionLanVP (Visual Pre-training)=false, LP (Language Pre-training)=false, AD (Annotated Data)=synth, #Params=33M2022.06 | 88.5 | |
| DiG (ViT-S)VP (Visual Pre-training)=true, LP (Language Pre-training)=false, AD (Annotated Data)=synth, #Params=36M2022.06 | 88.5 | |
| SRN-LV (Reproduced)Labeled Datasets=MJ+ST2021.03 | 88.2 | |
| SVTR-TBackbone=Tiny2022.04 | 88.2 | |
| SAMLabeled Datasets=MJ+ST2021.03 | 87.8 | |
| SRNLabeled Datasets=MJ+ST2021.03 | 87.8 | |
| SRNLanguage Mode=Lan-aware2022.04 | 87.8 | |
| SRNVP (Visual Pre-training)=false, LP (Language Pre-training)=false, AD (Annotated Data)=synth, #Params=55M2022.06 | 87.8 | |
| Yang et al. [53]*lexicon=lexicon-free, training_annotations=word-level and character-level2020.05 | 87.5 | |
| SRN-SV (Reproduced)Labeled Datasets=MJ+ST2021.03 | 87.5 | |
| MaskOCR (ViT-S)VP (Visual Pre-training)=false, LP (Language Pre-training)=false, AD (Annotated Data)=synth, #Params=31M2022.06 | 87.5 | |
| SCATTERVenue=CVPR’20, Training Set=MJ+ST+Extra, RNN=Y, FPS=-2022.04 | 87.5 | |
| ParallelLabeled Datasets=MJ+ST2021.03 | 86.8 | |
| ABINet*Language Mode=Lan-free2022.04 | 86.5 | |
| ABINetVP (Visual Pre-training)=false, LP (Language Pre-training)=false, AD (Annotated Data)=synth, #Params=24M2022.06 | 86.5 | |
| SRN*Language Mode=Lan-free2022.04 | 84.7 | |
| DANLabeled Datasets=MJ+ST2021.03 | 84.4 | |
| PIMNetVP (Visual Pre-training)=false, LP (Language Pre-training)=false, AD (Annotated Data)=synth2022.06 | 84.4 | |
| DANVenue=AAAI’20, Training Set=MJ+ST, RNN=Y, FPS=-2022.04 | 84.4 | |
| AutoSTRLanguage Mode=Lan-aware2022.04 | 84 | |
| Ours-LargeVenue=-, Training Set=MJ+ST, RNN=N, FPS=66.91/255+2022.04 | 83.68 | |
| SE-ASTER (Ours)lexicon=lexicon-free, training_annotations=word-level2020.05 | 83.6 | |
| SE-ASTERLabeled Datasets=MJ+ST2021.03 | 83.6 | |
| SEEDVP (Visual Pre-training)=false, LP (Language Pre-training)=true, AD (Annotated Data)=synth2022.06 | 83.6 | |
| SEEDVenue=CVPR’20, Training Set=MJ+ST, RNN=Y, FPS=-2022.04 | 83.6 | |
| SARLanguage Mode=Lan-aware2022.04 | 83.5 | |
| Zhan et al. [57]lexicon=lexicon-free, training_annotations=word-level2020.05 | 83.3 | |
| Li et al. [23]lexicon=lexicon-free, training_annotations=word-level2020.05 | 83.3 | |
| TextscannerLabeled Datasets=MJ+ST2021.03 | 83.3 | |
| TextScannerVP (Visual Pre-training)=false, LP (Language Pre-training)=false, AD (Annotated Data)=synth2022.06 | 83.3 | |
| SARVenue=AAAI’19, Training Set=MJ+ST, RNN=Y, FPS=-2022.04 | 83.3 | |
| ESIRVenue=CVPR’19, Training Set=MJ+ST, RNN=Y, FPS=-2022.04 | 83.3 | |
| TextScanner*Venue=AAAI’20, Training Set=MJ+ST+Extra, RNN=N, FPS=-2022.04 | 83.3 | |
| Xie et al. [52]lexicon=lexicon-free, training_annotations=word-level2020.05 | 82.6 | |
| ASTER baseline reproducedlexicon=lexicon-free, training_annotations=word-level2020.05 | 82.3 | |
| PREN*Language Mode=Lan-free2022.04 | 81.3 | |
| ViTSTRLanguage Mode=Lan-free2022.04 | 81.3 | |
| Liao et al. [25]*lexicon=lexicon-free, training_annotations=word-level and character-level2020.05 | 79.9 | |
| ASTER [45]lexicon=lexicon-free, training_annotations=word-level2020.05 | 79.5 | |
| ASTERLanguage Mode=Lan-aware2022.04 | 79.5 | |
| ASTERVP (Visual Pre-training)=false, LP (Language Pre-training)=false, AD (Annotated Data)=synth2022.06 | 79.5 | |
| CA-FCN*Venue=AAAI’19, Training Set=ST, RNN=N, FPS=452022.04 | 78.1 | |
| Luo et al. [32]lexicon=lexicon-free, training_annotations=word-level2020.05 | 77.4 | |
| MORANLanguage Mode=Lan-aware2022.04 | 77.4 | |
| Cheng et al. [8]lexicon=lexicon-free, training_annotations=word-level2020.05 | 76.8 | |
| Comb.BestVenue=ICCV’19, Training Set=MJ+ST, RNN=Y, FPS=36.232022.04 | 71.8 | |
| Yang et al. [54]*lexicon=lexicon-free, training_annotations=word-level and character-level2020.05 | 69.3 | |
| RosettaLanguage Mode=Lan-free2022.04 | 69.2 | |
| RosettaVenue=KDD’18, Training Set=MJ+ST, RNN=N, FPS=212.762022.04 | 69.2 | |
| CRNNLanguage Mode=Lan-free2022.04 | 65.5 | |
| Liu et al. [29]lexicon=lexicon-free, training_annotations=word-level2020.05 | 62.5 | |
| Shi et al. [44]lexicon=lexicon-free, training_annotations=word-level2020.05 | 59.2 | |
| OLMo 3Parameters=7B, Shots=52026.01 | 59 | |
| OLMo 2Parameters=7B, Shots=52026.01 | 54 | |
| Llama 2Parameters=7B, Shots=52026.01 | 40 | |
| UnfilteredShots=52026.01 | 33 | |
| Alignment UpsampledStrategy=Mid, Shots=52026.01 | 32 | |
| Alignment UpsampledStrategy=CPT, Shots=52026.01 | 32 | |
| Filtered + Alignment UpsampledStrategy=Mid, Shots=52026.01 | 32 | |
| Misalignment UpsampledStrategy=Mid, Shots=52026.01 | 32 | |
| Misalignment UpsampledStrategy=CPT, Shots=52026.01 | 32 | |
| Alignment UpsampledStrategy=E2E, Shots=52026.01 | 31 | |
| Filtered + Alignment UpsampledStrategy=CPT, Shots=52026.01 | 31 | |
| Filtered + Alignment UpsampledStrategy=E2E, Shots=52026.01 | 30 | |
| FilteredShots=52026.01 | 28 | |
| Misalignment UpsampledStrategy=E2E, Shots=52026.01 | 26 |