Referring Expression Comprehension on RefCOCO 80 (val)
92.99AccuracySimVG-TB
Evaluation Results
| Method | Links | |
|---|---|---|
| SimVG-TBVisual Encoder=ViT-L/32, Params (M)=1.58, Pre-train images=28K, Time (ms)=1012024.09 | 92.99 | |
| SimVG-DBVisual Encoder=ViT-L/32, Params (M)=6.32, Pre-train images=28K, Time (ms)=1162024.09 | 92.93 | |
| mPLUG-2Visual Encoder=ViT-L/14, Pre-train images=14M2024.09 | 92.4 | |
| SimVG-DBVisual Encoder=ViT-B/32, Params (M)=6.32, Pre-train images=174K, Time (ms)=522024.09 | 91.47 | |
| SimVG-DBVisual Encoder=ViT-B/32, Params (M)=6.32, Pre-train images=28K, Time (ms)=522024.09 | 90.98 | |
| SimVG-TBVisual Encoder=ViT-B/32, Params (M)=1.58, Pre-train images=174K, Time (ms)=442024.09 | 90.59 | |
| PolyFormerVisual Encoder=Swin-L, Pre-train images=174K2024.09 | 90.38 | |
| OFA-LVisual Encoder=RN152, Pre-train images=20M2024.09 | 90.05 | |
| PolyFormerVisual Encoder=Swin-B, Pre-train images=174K2024.09 | 89.73 | |
| GroundingDINOVisual Encoder=Swin-T, Pre-train images=200K, Time (ms)=1202024.09 | 89.19 | |
| DQ-DETRVisual Encoder=RN101, Pre-train images=200K2024.09 | 88.63 | |
| UniTABVisual Encoder=RN101, Pre-train images=200K2024.09 | 88.59 | |
| SeqTRVisual Encoder=DN53, Params (M)=7.90, Pre-train images=174K, Time (ms)=502024.09 | 87 | |
| MDETRVisual Encoder=RN101, Params (M)=17.36, Pre-train images=200K, Time (ms)=1082024.09 | 86.75 | |
| RefTRVisual Encoder=RN101, Params (M)=17.86, Pre-train images=100K, Time (ms)=402024.09 | 85.65 | |
| VILLA_LVisual Encoder=RN101, Pre-train images=4.6M2024.09 | 82.39 | |
| UNITER_LVisual Encoder=RN101, Pre-train images=4.6M2024.09 | 81.41 |