Scene Text Recognition on Union14M L (test)
76.8Curve AccuracySVTR-L
Evaluation Results
| Method | Links | ||||||||
|---|---|---|---|---|---|---|---|---|---|
| SVTR-LEncoder=SVTR-Large, Input Size=48 x 1602023.07 | 76.8 | 45.2 | 55.2 | 63 | 73.8 | 48.9 | 64.2 | 61.01 | |
| SVTR-B-CPPDEncoder=SVTR-Base, Input Size=48 x 1602023.07 | 71.9 | 22.1 | 60.5 | 67.9 | 78.3 | 63.9 | 67.1 | 61.69 | |
| SVTR-BEncoder=SVTR-Base, Input Size=48 x 1602023.07 | 69.8 | 37.7 | 47.9 | 61.4 | 66.8 | 44.8 | 61 | 55.63 | |
| NRTR-CPPDEncoder=SVTR-Base, Input Size=32 × 1002023.07 | 69.5 | 21 | 59.5 | 64.2 | 74.1 | 65.5 | 67 | 60.1 | |
| CDisNetEncoder=ResNet+En, Input Size=32 x 1282023.07 | 69.3 | 24.4 | 49.8 | 55.6 | 72.8 | 64.3 | 58.5 | 56.38 | |
| LPV-BEncoder=SVTR-Base, Input Size=48 x 1602023.07 | 68.3 | 21 | 59.6 | 65.1 | 76.2 | 63.6 | 62 | 59.4 | |
| PARSeq-CPPDEncoder=SVTR-Base, Input Size=32 × 1002023.07 | 67.1 | 19 | 58 | 58 | 74 | 61.9 | 63.9 | 57.19 | |
| ABINet-CPPDEncoder=SVTR-Base, Input Size=32 × 1002023.07 | 66.4 | 19.1 | 57.3 | 56.7 | 72.8 | 55.8 | 65 | 56.19 | |
| SVTR-B-NRTREncoder=SVTR-Base, Input Size=32 × 1002023.07 | 66.2 | 19.4 | 54 | 58.8 | 70.5 | 61.3 | 65.3 | 56.49 | |
| SVTR-B-CPPDEncoder=SVTR-Base, Input Size=32 × 1002023.07 | 65.5 | 18.6 | 56 | 61.9 | 71 | 57.5 | 65.8 | 56.63 | |
| PARSeq-BEncoder=SVTR-Base, Input Size=32 × 1002023.07 | 63.9 | 16.7 | 52.5 | 54.3 | 68.2 | 55.9 | 56.9 | 52.62 | |
| SRNEncoder=ResNet+FPN, Input Size=64 x 2562023.07 | 63.4 | 25.3 | 34.1 | 28.7 | 56.5 | 26.7 | 46.3 | 40.14 | |
| SVTR-TEncoder=SVTR-Tiny, Input Size=32 × 1002023.07 | 63 | 32.1 | 37.9 | 44.2 | 67.5 | 49.1 | 52.8 | 49.51 | |
| ABINet-BEncoder=SVTR-Base, Input Size=32 × 1002023.07 | 62.3 | 13.9 | 50 | 45.1 | 67.1 | 53.4 | 58.5 | 50.07 | |
| CTC-CPPDEncoder=SVTR-Base, Input Size=32 × 1002023.07 | 61.3 | 15.6 | 53.2 | 59.2 | 69.4 | 59.6 | 63.8 | 54.6 | |
| SVTR-T-NRTREncoder=SVTR-Tiny, Input Size=32 × 1002023.07 | 60.8 | 23.2 | 46.4 | 43.6 | 59 | 38.7 | 55.6 | 46.76 | |
| ABINetEncoder=ResNet+En, Input Size=32 x 1282023.07 | 59.5 | 12.7 | 43.3 | 38.3 | 62 | 50.8 | 55.6 | 46.03 | |
| VisionLANEncoder=ResNet+En, Input Size=64 x 2562023.07 | 57.7 | 14.2 | 47.8 | 48 | 64 | 47.9 | 52.1 | 47.39 | |
| SVTR-T-CPPDEncoder=SVTR-Tiny, Input Size=32 × 1002023.07 | 52.4 | 12.3 | 48.2 | 54.4 | 61.5 | 53.4 | 61.4 | 49.1 | |
| SAREncoder=ResNet, Input Size=48 x 1602023.07 | 44.3 | 7.7 | 42.6 | 44.2 | 44 | 51.2 | 50.5 | 40.64 | |
| RobustScannerEncoder=ResNet, Input Size=48 x 1602023.07 | 43.6 | 7.9 | 41.2 | 42.6 | 44.9 | 46.9 | 39.5 | 38.09 | |
| ASTEREncoder=ResNet, Input Size=32 × 1002023.07 | 34 | 10.2 | 27.7 | 33 | 48.2 | 27.6 | 39.8 | 31.5 | |
| NRTREncoder=CNN+En, Input Size=32 x 1002023.07 | 31.7 | 4.4 | 36.6 | 37.3 | 30.6 | 54.9 | 48 | 34.79 | |
| CRNNEncoder=ResNet+BiLSTM, Input Size=32 × 1002023.07 | 7.5 | 0.9 | 20.7 | 25.6 | 13.9 | 25.6 | 32 | 18.03 |