Scene Text Recognition on COCO-Text (test)
83AccuracyCLIP4STR-H
Evaluation Results
| Method | Links | |
|---|---|---|
| CLIP4STR-HTrain data=RBU(6.5M)2023.05 | 83 | |
| CLIP4STR-LTrain data=RBU(6.5M)2023.05 | 82.7 | |
| CLIP4STR-LTrain data=Real(3.3M)2023.05 | 81.9 | |
| CLIP4STR-BTrain data=RBU(6.5M)2023.05 | 81.3 | |
| CLIP4STR-BTrain data=Real(3.3M)2023.05 | 81.1 | |
| MPSTRTrain data=Real(3.3M)2023.05 | 80.3 | |
| PARSeqTrain data=Real(3.3M)2023.05 | 79.8 | |
| TRBATrain data=Real(3.3M)2023.05 | 77.5 | |
| ABINetTrain data=Real(3.3M)2023.05 | 76.5 | |
| DiG-ViT-BTrain data=Real(2.8M)2023.05 | 75.8 | |
| ViTSTR-STrain data=Real(3.3M)2023.05 | 73.6 | |
| Shi et al. 2018Lexicon=None, Training Level=word-level2018.11 | 72.3 | |
| Yang et al. 2017Lexicon=None, Training Level=word-level and character-level2018.11 | 69.3 | |
| TPS-ResNet-BiLSTM-AttnTrain Dataset=S90k+ST+TextOCR2021.05 | 69.15 | |
| STAR-NetTrain Dataset=S90k+ST+TextOCR2021.05 | 67.92 | |
| CLIP4STR-LTrain data=MJ+ST2023.05 | 67 | |
| SARLexicon=None, Training Level=word-level2018.11 | 66.8 | |
| CLIP-OCRTrain data=MJ+ST2023.05 | 66.5 | |
| CLIP4STR-BTrain data=MJ+ST2023.05 | 66.3 | |
| MPSTRTrain data=MJ+ST2023.05 | 64.5 | |
| TPS-ResNet-BiLSTM-AttnTrain Dataset=TextOCR2021.05 | 64.03 | |
| PARSeqTrain data=MJ+ST2023.05 | 64 | |
| RosettaTrain Dataset=S90k+ST+TextOCR2021.05 | 62.61 | |
| TRBATrain data=MJ+ST2023.05 | 61.4 | |
| CRNNTrain Dataset=S90k+ST+TextOCR2021.05 | 60.09 | |
| Liu, Chen, and Wong 2018Lexicon=None, Training Level=word-level and character-level2018.11 | 59.3 | |
| ABINetTrain data=MJ+ST2023.05 | 57.1 | |
| ViTSTR-STrain data=MJ+ST2023.05 | 56.4 | |
| TPS-ResNet-BiLSTM-AttnPW=true, Train Dataset=S90k+ST2021.05 | 56.34 | |
| STAR-NetPW=true, Train Dataset=S90k+ST2021.05 | 53.56 | |
| TPS-ResNet-BiLSTM-AttnTrain Dataset=COCOText2021.05 | 53.47 | |
| RosettaPW=true, Train Dataset=S90k+ST2021.05 | 49.66 | |
| CRNNPW=true, Train Dataset=S90k+ST2021.05 | 49 |