Scene Text Recognition on ICDAR 2015 (1811 images)
86.6AccuracySIGAT
Evaluation Results
| Method | Links | |
|---|---|---|
| SIGATType=V, Backbone=ViT-B, Structure=Transformer, Size=32×1282022.03 | 86.6 | |
| PARSeqType=VL, Backbone=DeiT, Structure=Transformer, Size=32×1282022.03 | 86.5 | |
| LevOCRType=VL, Backbone=ResNet45, Structure=ResNet, Size=32×1282022.03 | 86.4 | |
| ABINetType=VL, Backbone=ResNet45-Trns, Structure=Transformer, Size=32×1282022.03 | 86 | |
| LevOCRType=VL, Backbone=ViT, Structure=Transformer, Size=32×1282022.03 | 85.8 | |
| ABINet+ConCLRType=VL, Backbone=ResNet45-Trns, Structure=Transformer, Size=32×1282022.03 | 85.4 | |
| SIGARType=V, Backbone=ResNet45, Structure=ResNet, Size=32×1282022.03 | 85.1 | |
| S-GTRType=VL, Backbone=ResNet50Dilated-PPM, Structure=ResNet, Size=64×2562022.03 | 84.6 | |
| Bhunia et al.Type=VL, Backbone=ResNet50-FPN, Structure=ResNet, Size=32×1002022.03 | 84 | |
| VisionLANType=VL, Backbone=ResNet45, Structure=ResNet, Size=64×2562022.03 | 83.7 | |
| SRNType=VL, Backbone=ResNet50-FPN, Structure=ResNet, Size=64×2562022.03 | 82.7 |