Scene Text Recognition on CUTE80 288
95.1AccuracySVTR
Evaluation Results
| Method | Links | |
|---|---|---|
| SVTRBackbone=SVTR-L, Structure=Transformer*, Size=48×160, Venue=IJCAI20222022.03 | 95.1 | |
| SIGATBackbone=ViT-B, Structure=Transformer, Size=32×1282022.03 | 93.1 | |
| SIGAsBackbone=SVTR-L, Structure=Transformer*, Size=48×1602022.03 | 92 | |
| Corner TransformerBackbone=SATRN, Structure=Transformer, Size=32×128, Venue=ECCV20222022.03 | 92 | |
| PREN2DBackbone=EfficientNet-B3, Structure=CNN, Size=64×256, Venue=CVPR20212022.03 | 91.7 | |
| SIGARBackbone=ResNet45, Structure=CNN, Size=32×1282022.03 | 91.7 | |
| MGP-STRBackbone=ViT-B, Structure=Transformer, Size=32×128, Venue=ECCV20222022.03 | 90.3 | |
| ABINet+ConCLR+Backbone=ResNet45-Trns, Structure=Transformer, Size=32×128, Venue=AAAI20222022.03 | 89.2 | |
| S-GTR+Backbone=ResNet50Dilated-PPM, Structure=CNN, Size=64×256, Venue=AAAI20222022.03 | 88.4 | |
| SGBANetBackbone=ResNet45-FPN, Structure=CNN, Size=64×256, Venue=ECCV20222022.03 | 88.2 | |
| LevOCRBackbone=ResNet45, Structure=CNN, Size=32×128, Venue=ECCV20222022.03 | 87.8 | |
| Text is TextBackbone=ResNet31, Structure=CNN, Size=48×160, Venue=ICCV20212022.03 | 86.3 | |
| ABINetBackbone=ResNet45-Trns, Structure=Transformer, Size=32×128, Venue=CVPR20212022.03 | 85.1 | |
| PlugNetBackbone=ResNet37, Structure=CNN, Size=32×100, Venue=ECCV20202022.03 | 85 | |
| DANBackbone=ResNet45, Structure=CNN, Size=32×128, Venue=AAAI20202022.03 | 84.4 | |
| PIMNetBackbone=ResNet50-FPN, Structure=CNN, Size=64×256, Venue=ACM MM20212022.03 | 84.4 | |
| TextScannerBackbone=ResNet50, Structure=CNN, Size=64×256, Venue=AAAI20202022.03 | 83.3 | |
| LevOCRBackbone=ViT, Structure=Transformer, Size=32×128, Venue=ECCV20222022.03 | 83 | |
| ViTSTRBackbone=ViT-B, Structure=Transformer, Size=224×224, Venue=ICDAR20212022.03 | 81.3 | |
| TRBABackbone=ResNet31, Structure=CNN, Size=32×100, Venue=CVPR20212022.03 | 79.5 |