Described Object Detection on D3 XL
25.4mAPAPE-Ti + NEGTOME
Evaluation Results
| Method | Links | |
|---|---|---|
| APE-Ti + NEGTOMEBackbone=ViT-Ti, Text Encoder=CLIP, Detection Head=DETA2025.10 | 25.4 | |
| APE-TiBackbone=ViT-Ti, Text Encoder=CLIP, Detection Head=DETA2025.10 | 21.4 | |
| G-DINO-B + NEGTOMEBackbone=Swin-B, Text Encoder=BERT, Detection Head=DINO2025.10 | 21.3 | |
| OFA-DODBackbone=ResNet-101+ViT, Text Encoder=BART, Detection Head=Seq2Seq2025.10 | 18.4 | |
| Qwen-2.5-VL-3B + NEGTOMEBackbone=ViT-H, Text Encoder=Qwen-2.5, Detection Head=-2025.10 | 17.8 | |
| G-DINO-BBackbone=Swin-B, Text Encoder=BERT, Detection Head=DINO2025.10 | 16.5 | |
| Qwen-2.5-VL-3BBackbone=ViT-H, Text Encoder=Qwen-2.5, Detection Head=-2025.10 | 16 | |
| FIBER-B + GENBackbone=Swin-B, Text Encoder=RoBERTa-B, Detection Head=DyHead2025.10 | 14.2 | |
| FIBER-BBackbone=Swin-B, Text Encoder=RoBERTa-B, Detection Head=DyHead2025.10 | 13.1 | |
| GLIP-T + GENBackbone=Swin-T, Text Encoder=BERT, Detection Head=DyHead2025.10 | 11.5 | |
| GLIP-TBackbone=Swin-T, Text Encoder=BERT, Detection Head=DyHead2025.10 | 10.6 | |
| OWL-ViT-LBackbone=ViT-L, Text Encoder=CLIP, Detection Head=OWL-ViT2025.10 | 5.3 | |
| SPHINX-7BBackbone=CLIP,DINO-v2, Q-Former, Text Encoder=LLaMA-2, Detection Head=-2025.10 | 3.1 | |
| OFA-LBackbone=ResNet-101+ViT, Text Encoder=BART, Detection Head=Seq2Seq2025.10 | 2.1 |