Described Object Detection on D3 (Abs)
31.5mAPAPE-Ti + NEGTOME
Evaluation Results
| Method | Links | |
|---|---|---|
| APE-Ti + NEGTOMEBackbone=ViT-Ti, Text Encoder=CLIP, Detection Head=DETA2025.10 | 31.5 | |
| G-DINO-B + NEGTOMEBackbone=Swin-B, Text Encoder=BERT, Detection Head=DINO2025.10 | 29.7 | |
| FIBER-B + GENBackbone=Swin-B, Text Encoder=RoBERTa-B, Detection Head=DyHead2025.10 | 28.1 | |
| FIBER-B + W2SBackbone=Swin-B, Text Encoder=RoBERTa-B, Detection Head=DyHead2025.10 | 27.7 | |
| GLIP-T + W2SBackbone=Swin-T, Text Encoder=BERT, Detection Head=DyHead2025.10 | 27.1 | |
| APE-TiBackbone=ViT-Ti, Text Encoder=CLIP, Detection Head=DETA2025.10 | 26.9 | |
| FIBER-BBackbone=Swin-B, Text Encoder=RoBERTa-B, Detection Head=DyHead2025.10 | 26 | |
| GLIP-T + GENBackbone=Swin-T, Text Encoder=BERT, Detection Head=DyHead2025.10 | 23.7 | |
| G-DINO-BBackbone=Swin-B, Text Encoder=BERT, Detection Head=DINO2025.10 | 22.5 | |
| GLIP-TBackbone=Swin-T, Text Encoder=BERT, Detection Head=DyHead2025.10 | 21.5 | |
| Qwen-2.5-VL-3B + NEGTOMEBackbone=ViT-H, Text Encoder=Qwen-2.5, Detection Head=-2025.10 | 20.6 | |
| Qwen-2.5-VL-3BBackbone=ViT-H, Text Encoder=Qwen-2.5, Detection Head=-2025.10 | 19.2 | |
| OFA-DODBackbone=ResNet-101+ViT, Text Encoder=BART, Detection Head=Seq2Seq2025.10 | 15.4 | |
| SPHINX-7BBackbone=CLIP,DINO-v2, Q-Former, Text Encoder=LLaMA-2, Detection Head=-2025.10 | 7.9 | |
| OWL-ViT-LBackbone=ViT-L, Text Encoder=CLIP, Detection Head=OWL-ViT2025.10 | 6.4 | |
| OFA-LBackbone=ResNet-101+ViT, Text Encoder=BART, Detection Head=Seq2Seq2025.10 | 4.6 |