Described Object Detection on D3 (Pres)
32.9mAPAPE-Ti + NEGTOME
Evaluation Results
| Method | Links | |
|---|---|---|
| APE-Ti + NEGTOMEBackbone=ViT-Ti, Text Encoder=CLIP, Detection Head=DETA2025.10 | 32.9 | |
| APE-TiBackbone=ViT-Ti, Text Encoder=CLIP, Detection Head=DETA2025.10 | 29.9 | |
| G-DINO-B + NEGTOMEBackbone=Swin-B, Text Encoder=BERT, Detection Head=DINO2025.10 | 26.4 | |
| FIBER-B + W2SBackbone=Swin-B, Text Encoder=RoBERTa-B, Detection Head=DyHead2025.10 | 26 | |
| GLIP-T + W2SBackbone=Swin-T, Text Encoder=BERT, Detection Head=DyHead2025.10 | 25.6 | |
| FIBER-B + GENBackbone=Swin-B, Text Encoder=RoBERTa-B, Detection Head=DyHead2025.10 | 25.2 | |
| OFA-DODBackbone=ResNet-101+ViT, Text Encoder=BART, Detection Head=Seq2Seq2025.10 | 23.7 | |
| Qwen-2.5-VL-3B + NEGTOMEBackbone=ViT-H, Text Encoder=Qwen-2.5, Detection Head=-2025.10 | 22.8 | |
| FIBER-BBackbone=Swin-B, Text Encoder=RoBERTa-B, Detection Head=DyHead2025.10 | 21.5 | |
| GLIP-T + GENBackbone=Swin-T, Text Encoder=BERT, Detection Head=DyHead2025.10 | 20.6 | |
| G-DINO-BBackbone=Swin-B, Text Encoder=BERT, Detection Head=DINO2025.10 | 20.1 | |
| Qwen-2.5-VL-3BBackbone=ViT-H, Text Encoder=Qwen-2.5, Detection Head=-2025.10 | 18.5 | |
| GLIP-TBackbone=Swin-T, Text Encoder=BERT, Detection Head=DyHead2025.10 | 18.3 | |
| SPHINX-7BBackbone=CLIP,DINO-v2, Q-Former, Text Encoder=LLaMA-2, Detection Head=-2025.10 | 11.4 | |
| OWL-ViT-LBackbone=ViT-L, Text Encoder=CLIP, Detection Head=OWL-ViT2025.10 | 10.7 | |
| OFA-LBackbone=ResNet-101+ViT, Text Encoder=BART, Detection Head=Seq2Seq2025.10 | 4.1 |