Scene Text Recognition on ICDAR 2015
93.1Accuracy (No Lexicon)TRBA
Evaluation Results
| Method | Links | |
|---|---|---|
| TRBABackbone=ResNet31, Structure=CNN, Size=32×100, Venue=CVPR20212022.03 | 93.1 | |
| SIGAsBackbone=SVTR-L, Structure=Transformer*, Size=48×1602022.03 | 87.6 | |
| MGP-STRBackbone=ViT-B, Structure=Transformer, Size=32×128, Venue=ECCV20222022.03 | 87.2 | |
| SVTRBackbone=SVTR-L, Structure=Transformer*, Size=48×160, Venue=IJCAI20222022.03 | 86.6 | |
| SIGATBackbone=ViT-B, Structure=Transformer, Size=32×1282022.03 | 86.6 | |
| Corner TransformerBackbone=SATRN, Structure=Transformer, Size=32×128, Venue=ECCV20222022.03 | 86.3 | |
| SIGARBackbone=ResNet45, Structure=CNN, Size=32×1282022.03 | 85.1 | |
| ABINet+ConCLR+Backbone=ResNet45-Trns, Structure=Transformer, Size=32×128, Venue=AAAI20222022.03 | 84.4 | |
| LevOCRBackbone=ResNet45, Structure=CNN, Size=32×128, Venue=ECCV20222022.03 | 84 | |
| TextScanner+realTraining Data=ST + 90k + real2019.12 | 83.5 | |
| PIMNetBackbone=ResNet50-FPN, Structure=CNN, Size=64×256, Venue=ACM MM20212022.03 | 83.5 | |
| PREN2DBackbone=EfficientNet-B3, Structure=CNN, Size=64×256, Venue=CVPR20212022.03 | 83 | |
| SIGATBackbone=ViT-B, Structure=Transformer, Size=32×1282022.03 | 83 | |
| S-GTR+Backbone=ResNet50Dilated-PPM, Structure=CNN, Size=64×256, Venue=AAAI20222022.03 | 82.8 | |
| ABINetBackbone=ResNet45-Trns, Structure=Transformer, Size=32×128, Venue=CVPR20212022.03 | 82.7 | |
| LevOCRBackbone=ViT, Structure=Transformer, Size=32×128, Venue=ECCV20222022.03 | 82.4 | |
| PlugNetBackbone=ResNet37, Structure=CNN, Size=32×100, Venue=ECCV20202022.03 | 82.2 | |
| SIGARBackbone=ResNet45, Structure=CNN, Size=32×1282022.03 | 81.7 | |
| PIMNetBackbone=ResNet50-FPN, Structure=CNN, Size=64×256, Venue=ACM MM20212022.03 | 81 | |
| TextScanner-mutualTraining Data=ST2019.12 | 80.1 | |
| TextScanner-preTraining Data=ST2019.12 | 79.6 | |
| TextScanner+90kTraining Data=ST + 90k2019.12 | 79.4 | |
| TextScannerBackbone=ResNet50, Structure=CNN, Size=64×256, Venue=AAAI20202022.03 | 79.4 | |
| SARTraining Data=ST + 90k + real2019.12 | 78.8 | |
| ViTSTRBackbone=ViT-B, Structure=Transformer, Size=224×224, Venue=ICDAR20212022.03 | 78.5 | |
| SGBANetBackbone=ResNet45-FPN, Structure=CNN, Size=64×256, Venue=ECCV20222022.03 | 78.4 | |
| TRBABackbone=ResNet31, Structure=CNN, Size=32×100, Venue=CVPR20212022.03 | 78.3 | |
| DeepSoloBackbone=ViTAEv2-S2025.03 | 78.2 | |
| SRNBackbone=ResNet50-FPN, Structure=CNN, Size=64×256, Venue=CVPR20202022.03 | 77.5 | |
| DeepSoloBackbone=ResNet-502025.03 | 77.3 | |
| Text is TextBackbone=ResNet31, Structure=CNN, Size=48×160, Venue=ICCV20212022.03 | 76.9 | |
| ASTERTraining Data=ST + 90k2019.12 | 76.1 | |
| DANBackbone=ResNet45, Structure=CNN, Size=32×128, Venue=AAAI20202022.03 | 74.5 | |
| EPTraining Data=ST + 90k2019.12 | 73.9 | |
| SPTS2025.03 | 73.5 | |
| TESTR2025.03 | 73.3 | |
| MANGO2025.03 | 72.9 | |
| ViTSTRBackbone=ViT-B, Structure=Transformer, Size=224×224, Venue=ICDAR20212022.03 | 72.6 | |
| FANTraining Data=ST + 90k2019.12 | 70.6 | |
| MaskTextSpotter2025.03 | 70.3 | |
| AONTraining Data=ST + 90k2019.12 | 68.2 |