Scene Text Recognition on IC13, IC15, IIIT, SVT, SVTP, CUTE80 Average (test)
97.42Average AccuracyCLIP4STR-L*
Evaluation Results
| Method | Links | |||||||
|---|---|---|---|---|---|---|---|---|
| CLIP4STR-L*Training data=REBU-Syn2023.12 | 97.42 | — | — | — | — | — | — | |
| CLIP4STR-B*Training data=REBU-Syn2023.12 | 97.25 | — | — | — | — | — | — | |
| CLIP4STR-LTraining data=Real2023.12 | 97.06 | — | — | — | — | — | — | |
| CLIP4STR-BTraining data=Real2023.12 | 96.89 | — | — | — | — | — | — | |
| SVTRv2Type=CTC, Training Data=U14M-Filter2026.02 | 96.57 | 98.7 | 98 | 99.2 | 91.1 | 93.5 | 99 | |
| SVTRv2-ARType=AR, Training Data=U14M-Filter2026.02 | 96.56 | 98.6 | 97.37 | 99.03 | 90.56 | 95.5 | 98.26 | |
| CPPDType=PD, Training Data=U14M-Filter2026.02 | 96.4 | 98.2 | 97.8 | 99 | 90.4 | 94 | 99 | |
| PARSeqType=AR, Training Data=U14M-Filter2026.02 | 96.4 | 98.4 | 98.1 | 98.9 | 90.1 | 94.3 | 98.6 | |
| MAERecType=AR, Training Data=U14M-Filter2026.02 | 96.36 | 98.2 | 97.8 | 99.2 | 90.4 | 94.3 | 98.3 | |
| MAERec-BTraining data=Union14M-L2023.12 | 96.15 | — | — | — | — | — | — | |
| BUSNetType=PD, Training Data=U14M-Filter2026.02 | 96.06 | 97.8 | 98.1 | 98.3 | 90.2 | 95.3 | 96.5 | |
| ABINetTraining data=Real2023.12 | 96.01 | — | — | — | — | — | — | |
| LPVType=PD, Training Data=U14M-Filter2026.02 | 95.93 | 98.1 | 97.8 | 98.6 | 89.8 | 93.6 | 97.6 | |
| SMTRType=AR, Training Data=U14M-Filter2026.02 | 95.9 | 98.3 | 97.4 | 99 | 90.1 | 92.7 | 97.9 | |
| ABINetType=PD, Training Data=U14M-Filter2026.02 | 95.83 | 97.7 | 98.1 | 98.5 | 90.1 | 94.1 | 96.5 | |
| OTEType=AR, Training Data=U14M-Filter2026.02 | 95.74 | 98 | 96.6 | 98.6 | 90.1 | 94 | 97.2 | |
| MaskOCR (ViT-S)VP (Visual Pre-training)=true, LP (Language Pre-training)=true, AD (Annotated Data)=real, #Params=31M2022.06 | 95.6 | — | — | — | — | — | — | |
| MaskOCR (ViT-B)VP (Visual Pre-training)=true, LP (Language Pre-training)=true, AD (Annotated Data)=real, #Params=97M2022.06 | 95.6 | — | — | — | — | — | — | |
| PARSeqATraining data=Real, Reproduced=true2023.12 | 95.57 | — | — | — | — | — | — | |
| MAERecType=AR, Training Data=UnionST-S2026.02 | 95.57 | 98.48 | 96.91 | 98.1 | 88.13 | 95.97 | 95.83 | |
| SVTRv2Type=CTC, Training Data=UnionST-S2026.02 | 95.35 | 98.6 | 95.98 | 98.2 | 87.85 | 94.26 | 97.22 | |
| SVTRv2-ARType=AR, Training Data=UnionST-S2026.02 | 95.32 | 98.48 | 95.98 | 98.2 | 88.29 | 94.11 | 96.87 | |
| DiG (ViT-B)VP (Visual Pre-training)=true, LP (Language Pre-training)=false, AD (Annotated Data)=real, #Params=52M2022.06 | 94.9 | — | — | — | — | — | — | |
| DiG-ViT-BTraining data=Real2023.12 | 94.86 | — | — | — | — | — | — | |
| ViTSTR-STraining data=Real2023.12 | 94.85 | — | — | — | — | — | — | |
| DiG (ViT-S)VP (Visual Pre-training)=true, LP (Language Pre-training)=false, AD (Annotated Data)=real, #Params=36M2022.06 | 94.6 | — | — | — | — | — | — | |
| MAERec-SVP (Visual Pre-training)=true, LP (Language Pre-training)=false, AD (Annotated Data)=real, #Params=21M2022.06 | 94.6 | — | — | — | — | — | — | |
| SVTRType=CTC, Training Data=U14M-Filter2026.02 | 94.58 | 97.3 | 97.1 | 98 | 88.6 | 90.7 | 95.8 | |
| NRTR-CPPDEncoder=SVTR-Base, Input Size=32 x 100, Parameters=32.3M, FPS=31.12023.07 | 94.5 | 98.6 | 96.6 | 97.6 | 88.8 | 91.9 | 93.4 | |
| SVTR-B-CPPDEncoder=SVTR-Base, Input Size=48 x 160, Parameters=26.8M, FPS=2062023.07 | 94.1 | 97.5 | 95.5 | 97.7 | 87.7 | 92.4 | 93.7 | |
| ABINet-CPPDEncoder=SVTR-Base, Input Size=32 x 100, Parameters=38.9M, FPS=1412023.07 | 94.01 | 98 | 96.3 | 97.2 | 87.6 | 92.6 | 92.1 | |
| SVTR-B-CPPDEncoder=SVTR-Base, Input Size=32 x 100, Parameters=26.8M, FPS=2522023.07 | 93.8 | 98.2 | 95.5 | 97.6 | 87.9 | 90.9 | 92.7 | |
| MaskOCRFT data=MJ+ST2022.05 | 93.8 | — | — | — | — | — | — | |
| LPV-BEncoder=SVTR-Base, Input Size=48 x 160, Parameters=35.1M, FPS=1032023.07 | 93.78 | 97.6 | 94.6 | 97.3 | 87.5 | 90.9 | 94.8 | |
| MaskOCR(ViT-L)Training data=MJ+ST2023.12 | 93.78 | — | — | — | — | — | — | |
| SMTRType=AR, Training Data=UnionST-S2026.02 | 93.74 | 97.78 | 95.52 | 97.67 | 86.36 | 91.01 | 94.1 | |
| LPVType=PD, Training Data=UnionST-S2026.02 | 93.73 | 96.85 | 95.98 | 97.77 | 86.47 | 90.85 | 94.44 | |
| PARSeq-CPPDEncoder=SVTR-Base, Input Size=32 x 100, Parameters=24.2M, FPS=98.22023.07 | 93.71 | 97.3 | 95.7 | 97.4 | 87.6 | 90.9 | 93.4 | |
| CPPDType=PD, Training Data=UnionST-S2026.02 | 93.66 | 96.85 | 95.36 | 97.17 | 85.15 | 91.94 | 95.49 | |
| PARSeqType=AR, Training Data=UnionST-S2026.02 | 93.55 | 97.32 | 94.74 | 97.77 | 85.64 | 92.09 | 93.75 | |
| OTEType=AR, Training Data=UnionST-S2026.02 | 93.55 | 97.32 | 94.74 | 97.77 | 85.64 | 92.09 | 93.75 | |
| SVTR-B-NRTREncoder=SVTR-Base, Input Size=32 x 100, Parameters=32.2M, FPS=32.52023.07 | 93.54 | 97.7 | 95.4 | 97.4 | 88.5 | 90.7 | 91.7 | |
| BUSNetType=PD, Training Data=UnionST-S2026.02 | 93.52 | 96.62 | 95.52 | 97.2 | 85.75 | 91.94 | 94.1 | |
| SVTRType=CTC, Training Data=UnionST-S2026.02 | 93.46 | 97.78 | 94.28 | 97.5 | 85.64 | 90.08 | 95.49 | |
| DiG-ViT-BTraining data=MJ+ST2023.12 | 93.41 | — | — | — | — | — | — | |
| DiG (ViT-B)VP (Visual Pre-training)=true, LP (Language Pre-training)=false, AD (Annotated Data)=synth, #Params=52M2022.06 | 93.4 | — | — | — | — | — | — | |
| TrOCRLargeTraining data=MJ+ST+B2023.12 | 93.23 | — | — | — | — | — | — | |
| MATRNTraining data=MJ+ST2023.12 | 93.2 | — | — | — | — | — | — | |
| PARSeqATraining data=MJ+ST2023.12 | 93.16 | — | — | — | — | — | — | |
| DiG (ViT-S)VP (Visual Pre-training)=true, LP (Language Pre-training)=false, AD (Annotated Data)=synth, #Params=36M2022.06 | 93.1 | — | — | — | — | — | — | |
| MaskOCR (ViT-B)VP (Visual Pre-training)=true, LP (Language Pre-training)=true, AD (Annotated Data)=synth, #Params=97M2022.06 | 93.1 | — | — | — | — | — | — | |
| MaskOCR(ViT-B)Training data=MJ+ST2023.12 | 93.1 | — | — | — | — | — | — | |
| CTC-CPPDEncoder=SVTR-Base, Input Size=32 x 100, Parameters=24.6M, FPS=2122023.07 | 93.02 | 96.8 | 95.2 | 96.9 | 87.2 | 90.2 | 91.7 | |
| MaskOCR (ViT-S)VP (Visual Pre-training)=true, LP (Language Pre-training)=true, AD (Annotated Data)=synth, #Params=31M2022.06 | 93 | — | — | — | — | — | — | |
| GITFT data=MJ+ST2022.05 | 92.9 | — | — | — | — | — | — | |
| ABINetType=PD, Training Data=UnionST-S2026.02 | 92.81 | 96.97 | 93.35 | 97 | 85.04 | 90.39 | 94.1 | |
| ConCLRVP (Visual Pre-training)=false, LP (Language Pre-training)=true, AD (Annotated Data)=synth, #Params=37M2022.06 | 92.8 | — | — | — | — | — | — | |
| MaskOCR (ViT-B)VP (Visual Pre-training)=false, LP (Language Pre-training)=false, AD (Annotated Data)=synth, #Params=97M2022.06 | 92.7 | — | — | — | — | — | — | |
| ABINetVP (Visual Pre-training)=false, LP (Language Pre-training)=true, AD (Annotated Data)=synth, #Params=37M2022.06 | 92.7 | — | — | — | — | — | — | |
| ABINetTraining data=MJ+ST2023.12 | 92.66 | — | — | — | — | — | — | |
| CDistNetEncoder=ResNet+En, Input Size=32 x 128, Parameters=65.5M, FPS=14.52023.07 | 92.57 | 97.4 | 93.5 | 96.4 | 86 | 88.7 | 93.4 | |
| SVTR-LEncoder=SVTR-Large, Input Size=48 x 160, Parameters=40.8M, FPS=1612023.07 | 92.54 | 97.2 | 91.7 | 96.3 | 86.6 | 88.4 | 95.1 | |
| PARSeqEncoder=ViT, Input Size=32 x 128, Parameters=23.8M, FPS=84.72023.07 | 92.53 | 97 | 93.6 | 97 | 86.5 | 88.9 | 92.2 | |
| MaskOCR (ViT-S)VP (Visual Pre-training)=false, LP (Language Pre-training)=false, AD (Annotated Data)=synth, #Params=31M2022.06 | 92.5 | — | — | — | — | — | — | |
| PerSecVP (Visual Pre-training)=true, LP (Language Pre-training)=false, AD (Annotated Data)=synth2022.06 | 92.4 | — | — | — | — | — | — | |
| SVTR-T-CPPDEncoder=SVTR-Tiny, Input Size=32 x 100, Parameters=8.29M, FPS=3992023.07 | 92.25 | 97.1 | 94.4 | 96.6 | 86.6 | 88.5 | 90.3 | |
| ViT-CTCType=CTC, Training Data=U14M-Filter2026.02 | 92.1 | 95.45 | 94.13 | 97.2 | 86.03 | 87.75 | 92.01 | |
| ABINetEncoder=ResNet+En, Input Size=32 x 128, Parameters=36.7M, FPS=1242023.07 | 91.93 | 97.4 | 93.5 | 96.2 | 86 | 89.3 | 89.2 | |
| GTREncoder=ResNet, Input Size=64 x 256, Parameters=42.1M2023.07 | 91.92 | 96.8 | 94.1 | 95.8 | 84.6 | 87.9 | 92.3 | |
| SVTR-BEncoder=SVTR-Base, Input Size=48 x 160, Parameters=24.6M, FPS=2122023.07 | 91.9 | 97.1 | 91.5 | 96 | 85.2 | 89.9 | 91.7 | |
| ABINetFT data=MJ+ST2022.05 | 91.9 | — | — | — | — | — | — | |
| S-GTRFT data=MJ+ST2022.05 | 91.9 | — | — | — | — | — | — | |
| ViT-CTCType=CTC, Training Data=UnionST-S2026.02 | 91.88 | 97.2 | 93.35 | 96.33 | 83.49 | 88.22 | 92.71 | |
| SVTR-T-NRTREncoder=SVTR-Tiny, Input Size=32 x 100, Parameters=8.56M, FPS=45.52023.07 | 91.49 | 97.3 | 93.4 | 95 | 85.5 | 88.2 | 89.6 | |
| PETRTraining data=MJ+ST2023.12 | 91.42 | — | — | — | — | — | — | |
| VisionLANTraining data=MJ+ST2023.12 | 91.23 | — | — | — | — | — | — | |
| VisionLanVP (Visual Pre-training)=false, LP (Language Pre-training)=false, AD (Annotated Data)=synth, #Params=33M2022.06 | 91.2 | — | — | — | — | — | — | |
| TextScannerTraining data=MJ+ST2023.12 | 91.15 | — | — | — | — | — | — | |
| PIMNetVP (Visual Pre-training)=false, LP (Language Pre-training)=false, AD (Annotated Data)=synth2022.06 | 90.5 | — | — | — | — | — | — | |
| SRNTraining data=MJ+ST2023.12 | 90.42 | — | — | — | — | — | — | |
| SRNVP (Visual Pre-training)=false, LP (Language Pre-training)=false, AD (Annotated Data)=synth, #Params=55M2022.06 | 90.4 | — | — | — | — | — | — | |
| TrOCRVP (Visual Pre-training)=true, LP (Language Pre-training)=true, AD (Annotated Data)=synth, #Params=558M2022.06 | 90.3 | — | — | — | — | — | — | |
| VisionLANEncoder=ResNet+En, Input Size=64 x 256, Parameters=32.8M, FPS=2002023.07 | 90.23 | 95.7 | 91.7 | 95.8 | 83.7 | 86 | 88.5 | |
| CRNNType=CTC, Training Data=U14M-Filter2026.02 | 90.21 | 94.6 | 91.8 | 95.8 | 84.9 | 83.1 | 91 | |
| I2C2WVP (Visual Pre-training)=false, LP (Language Pre-training)=false, AD (Annotated Data)=synth2022.06 | 90.2 | — | — | — | — | — | — | |
| TRBATraining data=MJ+ST2023.12 | 90.07 | — | — | — | — | — | — | |
| I2C2WEncoder=ResNet+En, Input Size=64 x 6002023.07 | 90 | 95 | 91.7 | 94.3 | 82.8 | 83.1 | 93.1 | |
| SVTR-TEncoder=SVTR-Tiny, Input Size=32 x 100, Parameters=6.03M, FPS=4082023.07 | 89.99 | 96.3 | 91.6 | 94.4 | 84.1 | 85.4 | 88.2 | |
| GITFT data=TextCaps2022.05 | 89.9 | — | — | — | — | — | — | |
| ABINetVP (Visual Pre-training)=false, LP (Language Pre-training)=false, AD (Annotated Data)=synth, #Params=24M2022.06 | 89.8 | — | — | — | — | — | — | |
| NRTR-reEncoder=CNN+En, Input Size=32 x 100, Parameters=31.7M, FPS=33.22023.07 | 89.62 | 96.6 | 91.8 | 93 | 83.4 | 86.8 | 86.1 | |
| SRNFT data=MJ+ST2022.05 | 89.6 | — | — | — | — | — | — | |
| SRNEncoder=ResNet+FPN, Input Size=64 x 256, Parameters=54.7M, FPS=39.42023.07 | 89.57 | 95.5 | 91.5 | 94.8 | 82.7 | 85.1 | 87.8 | |
| SE-ASTERTraining data=MJ+ST2023.12 | 88.35 | — | — | — | — | — | — | |
| SEEDVP (Visual Pre-training)=false, LP (Language Pre-training)=true, AD (Annotated Data)=synth2022.06 | 88.3 | — | — | — | — | — | — | |
| SAMFT data=MJ+ST2022.05 | 87.8 | — | — | — | — | — | — | |
| RobustScannerEncoder=ResNet, Input Size=48 x 160, Parameters=48.0M, FPS=16.42023.07 | 87.52 | 94.8 | 88.1 | 95.3 | 77.1 | 79.5 | 90.3 | |
| Ro.ScannerFT data=MJ+ST2022.05 | 87.5 | — | — | — | — | — | — | |
| NRTREncoder=CNN+En, Input Size=32 x 100, Parameters=31.7M, FPS=33.22023.07 | 87.38 | 95.8 | 91.5 | 90.1 | 79.4 | 86.6 | 80.9 | |
| ASTERVP (Visual Pre-training)=false, LP (Language Pre-training)=false, AD (Annotated Data)=synth2022.06 | 86.7 | — | — | — | — | — | — |