Visual Grounding on RefCOCO, RefCOCO+, RefCOCOg, and OCID-Ref
69.52RefCOCO AccuracyVMamba-S
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| VMamba-SPretrained Dataset=IN1K → COCO, Encoder Size=50M, Image Size=1333x800, Vision Token #=41502026.03 | 69.52 | 52.87 | 63.5 | 28.15 | 47.94 | 60.78 | |
| ViTDet-BPretrained Dataset=IN1K → COCO, Encoder Size=111M, Image Size=1024x1024, Vision Token #=40962026.03 | 66.03 | 51.17 | 58.17 | 22.37 | 43.74 | 60.42 | |
| VMamba-SPretrained Dataset=IN1K → ADE20K, Encoder Size=50M, Image Size=512x512, Vision Token #=10242026.03 | 64.17 | 53.98 | 59.13 | 24.58 | 44.98 | 60.76 | |
| VMamba-BPretrained Dataset=IN1K → ADE20K, Encoder Size=89M, Image Size=512x512, Vision Token #=10242026.03 | 63.99 | 52.52 | 58.68 | 25.91 | 45.08 | 60.48 | |
| VMamba-TPretrained Dataset=IN1K → ADE20K, Encoder Size=30M, Image Size=512x512, Vision Token #=10242026.03 | 62.65 | 51.1 | 57.15 | 24.01 | 43.47 | 60.03 | |
| ViTDet-HPretrained Dataset=IN1K → COCO, Encoder Size=662M, Image Size=1024x1024, Vision Token #=40962026.03 | 56.41 | 40.48 | 50.25 | 16.01 | 35.38 | 58.33 | |
| DeiT-BPretrained Dataset=IN1K → ADE20K, Encoder Size=134M, Image Size=512x512, Vision Token #=2562026.03 | 52.17 | 39.78 | 45.61 | 16.22 | 33.77 | 57.07 | |
| DeiT-SPretrained Dataset=IN1K → ADE20K, Encoder Size=58M, Image Size=512x512, Vision Token #=2562026.03 | 49.52 | 37.07 | 42.46 | 15.35 | 31.78 | 55.65 | |
| VMamba-TPretrained Dataset=IN1K → COCO, Encoder Size=30M, Image Size=1333x800, Vision Token #=41502026.03 | 29.1 | 16.83 | 19.89 | 3.95 | 14.86 | 52.25 | |
| VMamba-BPretrained Dataset=IN1K → COCO, Encoder Size=89M, Image Size=1333x800, Vision Token #=41502026.03 | 28.43 | 16.44 | 19.87 | 4.97 | 15.02 | 52.72 | |
| ViTDet-LPretrained Dataset=IN1K → COCO, Encoder Size=331M, Image Size=1024x1024, Vision Token #=40962026.03 | 24.62 | 13.79 | 17.44 | 4.62 | 13.05 | 51.65 |