Scene Text Recognition on TextOCR + Open Images (10% labeled samples)
93.8AccuracyMaskOCR
Evaluation Results
| Method | Links | |
|---|---|---|
| MaskOCRPre-training=Visual-Language, Backbone=ViT-S, Number of parameters=31M2022.06 | 93.8 | |
| MaskOCRPre-training=Visual, Backbone=ViT-S, Number of parameters=31M2022.06 | 92.6 | |
| DiGPre-training=Visual, Backbone=ViT-S, Number of parameters=36M2022.06 | 92 | |
| MaskOCRPre-training=Scratch, Backbone=ViT-S, Number of parameters=31M2022.06 | 90.6 | |
| CRNNPre-training=Scratch, Backbone=CRNN, Number of parameters=25M2022.06 | 79.6 | |
| DiGPre-training=Scratch, Backbone=ViT-S, Number of parameters=36M2022.06 | 73.4 |