Referring Expression Object Segmentation on RefCOCOg UMD (val)
75.7cIoUGSVA-Llama2-13B
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| GSVA-Llama2-13BBackbone=Llama2-13B, Fine-tuning=true2023.12 | 75.7 | — | |
| GSVA-Vicuna-13BBackbone=Vicuna-13B, Fine-tuning=true2023.12 | 74.2 | — | |
| Vision Banana2026.04 | 73.8 | — | |
| SAM3 Agent2026.04 | 73.4 | — | |
| GSVA-Llama2-13BBackbone=Llama2-13B, Fine-tuning=false2023.12 | 73.2 | — | |
| GSVA-Vicuna-7BBackbone=Vicuna-7B, Fine-tuning=true2023.12 | 72.7 | — | |
| GSVA-Vicuna-7BBackbone=Vicuna-7B, Fine-tuning=false2023.12 | 71.1 | — | |
| LISA-Llama2-13BBackbone=Llama2-13B, Fine-tuning=true2023.12 | 70.1 | — | |
| GSVA-Vicuna-13BBackbone=Vicuna-13B, Fine-tuning=false2023.12 | 69.6 | — | |
| LISA-Vicuna-13BBackbone=Vicuna-13B, Fine-tuning=true2023.12 | 69.5 | — | |
| PolyFormer-L2023.12 | 69.2 | — | |
| LISA-Llama2-13BBackbone=Llama2-13B, Fine-tuning=false2023.12 | 68.2 | — | |
| LISA-Vicuna-7BBackbone=Vicuna-7B, Fine-tuning=true2023.12 | 67.9 | — | |
| LISA-Vicuna-7BBackbone=Vicuna-7B, Fine-tuning=false2023.12 | 66.4 | — | |
| SEEM2023.12 | 65.7 | — | |
| LISA-Vicuna-13BBackbone=Vicuna-13B, Fine-tuning=false2023.12 | 65.2 | — | |
| ReLA2023.12 | 65 | — | |
| X-Decoder2023.12 | 64.6 | — | |
| LAVT2023.12 | 61.2 | — | |
| CRIS2023.12 | 59.9 | — | |
| VLT2023.12 | 55 | — | |
| MCN2023.12 | 49.2 | — | |
| + caption-aware consistencyInfo=Joint training2019.10 | — | 60.69 | |
| + spatial coordsInfo=Location2019.10 | — | 61.37 | |
| + spatial-aware filtersInfo=Location2019.10 | — | 61.65 | |
| baseline2019.10 | — | 54.18 | |
| full modelInfo=Location, Joint training2019.10 | — | 62.34 | |
| Liu et al.Info=Attribute prediction, Joint training2019.10 | — | 52.35 | |
| Luo et al.Info=Joint training2019.10 | — | 49.07 | |
| VCInfo=Context2019.10 | — | 62.3 | |
| Yu et al.Info=Joint training2019.10 | — | 59.84 |