Described Object Detection on D3 (S)
35.5mAPFIBER-B + GEN
Evaluation Results
| Method | Links | |
|---|---|---|
| FIBER-B + GENBackbone=Swin-B, Text Encoder=RoBERTa-B, Detection Head=DyHead2025.10 | 35.5 | |
| APE-Ti + NEGTOMEBackbone=ViT-Ti, Text Encoder=CLIP, Detection Head=DETA2025.10 | 33.2 | |
| APE-TiBackbone=ViT-Ti, Text Encoder=CLIP, Detection Head=DETA2025.10 | 31.1 | |
| FIBER-BBackbone=Swin-B, Text Encoder=RoBERTa-B, Detection Head=DyHead2025.10 | 30.1 | |
| G-DINO-B + NEGTOMEBackbone=Swin-B, Text Encoder=BERT, Detection Head=DINO2025.10 | 29.9 | |
| GLIP-T + GENBackbone=Swin-T, Text Encoder=BERT, Detection Head=DyHead2025.10 | 28.1 | |
| OFA-DODBackbone=ResNet-101+ViT, Text Encoder=BART, Detection Head=Seq2Seq2025.10 | 23.6 | |
| G-DINO-BBackbone=Swin-B, Text Encoder=BERT, Detection Head=DINO2025.10 | 22.6 | |
| GLIP-TBackbone=Swin-T, Text Encoder=BERT, Detection Head=DyHead2025.10 | 22.4 | |
| OWL-ViT-LBackbone=ViT-L, Text Encoder=CLIP, Detection Head=OWL-ViT2025.10 | 20.7 | |
| Qwen-2.5-VL-3B + NEGTOMEBackbone=ViT-H, Text Encoder=Qwen-2.5, Detection Head=-2025.10 | 19.8 | |
| Qwen-2.5-VL-3BBackbone=ViT-H, Text Encoder=Qwen-2.5, Detection Head=-2025.10 | 18.2 | |
| SPHINX-7BBackbone=CLIP,DINO-v2, Q-Former, Text Encoder=LLaMA-2, Detection Head=-2025.10 | 16.8 | |
| OFA-LBackbone=ResNet-101+ViT, Text Encoder=BART, Detection Head=Seq2Seq2025.10 | 4.9 |