Referring Expression Comprehension on RefCOCO+ (test)
74.22AccuracyOur SAT->ST
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Our SAT->STBackbone=BERTB, Training Strategy=All-Task Pretraining + Single-Task Finetuning, Number of Parameters=3B, Number of Models=12 x 250M2019.12 | 74.22 | — | |
| UNITER [8]Backbone=BERTL, Number of Parameters=2.1B, Number of Models=7 x 303M2019.12 | 73.73 | — | |
| Our SATBackbone=BERTB, Training Strategy=All-Task (AT), Number of Parameters=270M, Number of Models=1 x 270M2019.12 | 73.25 | — | |
| UNITER [8]Backbone=BERTB, Number of Parameters=602M, Number of Models=7 x 86M2019.12 | 72.9 | — | |
| Qwen2-VLParameters=7B2026.02 | — | 76.5 | |
| Qwen2.5-VLParameters=7B2026.02 | — | 88.2 | |
| RegionReasonerParameters=7B2026.02 | — | 88.6 | |
| VisionReasonerParameters=7B2026.02 | — | 87.9 |