Scene Text Recognition on ICDAR 2013 (857 images)
97.8AccuracySIGAT
Evaluation Results
| Method | Links | |
|---|---|---|
| SIGATType=V, Backbone=ViT-B, Structure=Transformer, Size=32×1282022.03 | 97.8 | |
| ABINet+ConCLRType=VL, Backbone=ResNet45-Trns, Structure=Transformer, Size=32×1282022.03 | 97.7 | |
| ABINetType=VL, Backbone=ResNet45-Trns, Structure=Transformer, Size=32×1282022.03 | 97.4 | |
| SIGARType=V, Backbone=ResNet45, Structure=ResNet, Size=32×1282022.03 | 97 | |
| PARSeqType=VL, Backbone=DeiT, Structure=Transformer, Size=32×1282022.03 | 97 | |
| LevOCRType=VL, Backbone=ResNet45, Structure=ResNet, Size=32×1282022.03 | 96.9 | |
| S-GTRType=VL, Backbone=ResNet50Dilated-PPM, Structure=ResNet, Size=64×2562022.03 | 96.8 | |
| LevOCRType=VL, Backbone=ViT, Structure=Transformer, Size=32×1282022.03 | 96.2 | |
| VisionLANType=VL, Backbone=ResNet45, Structure=ResNet, Size=64×2562022.03 | 95.7 | |
| SRNType=VL, Backbone=ResNet50-FPN, Structure=ResNet, Size=64×2562022.03 | 95.5 | |
| Bhunia et al.Type=VL, Backbone=ResNet50-FPN, Structure=ResNet, Size=32×1002022.03 | 95.5 |