Scene Text Recognition on TextOCR + Open Images 1% labeled samples
90.9AccuracyMaskOCR
Evaluation Results
| Method | Links | |
|---|---|---|
| MaskOCRPre-training=Visual-Language, Backbone=ViT-S, Number of parameters=31M2022.06 | 90.9 | |
| MaskOCRPre-training=Visual, Backbone=ViT-S, Number of parameters=31M2022.06 | 87.7 | |
| DiGPre-training=Visual, Backbone=ViT-S, Number of parameters=36M2022.06 | 84.6 | |
| MaskOCRPre-training=Scratch, Backbone=ViT-S, Number of parameters=31M2022.06 | 72.3 | |
| CRNNPre-training=Scratch, Backbone=CRNN, Number of parameters=25M2022.06 | 63.5 | |
| DiGPre-training=Scratch, Backbone=ViT-S, Number of parameters=36M2022.06 | 9.2 |