Object Detection on MSOSB (val)
41.5APrExDet (DeCLIP)
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| ExDet (DeCLIP)Backbone=ViT-L/14, Training Data=LVIS-base2026.06 | 41.5 | 45.7 | |
| ExDet (CLIPSelf)Backbone=ViT-L/14, Training Data=LVIS-base2026.06 | 40.9 | 44.3 | |
| DVtor (DeCLIP)Backbone=ViT-L/14, Training Data=LVIS-base2026.06 | 40.1 | 45 | |
| DVtor (CLIPSelf)Backbone=ViT-L/14, Training Data=LVIS-base2026.06 | 39.8 | 43.9 | |
| F-ViT (DeCLIP)Backbone=ViT-L/14, Training Data=LVIS-base2026.06 | 38.8 | 43.3 | |
| F-ViT (CLIPSelf)Backbone=ViT-L/14, Training Data=LVIS-base2026.06 | 38.2 | 42.6 | |
| ExDet (DeCLIP)Backbone=ViT-B/16, Training Data=LVIS-base2026.06 | 34.1 | 38.8 | |
| ExDet (CLIP)Backbone=RN50×16, Training Data=LVIS-base2026.06 | 33.6 | 39.7 | |
| DVtor (CLIP)Backbone=RN50×16, Training Data=LVIS-base2026.06 | 32.8 | 39 | |
| ExDet (CLIPSelf)Backbone=ViT-B/16, Training Data=LVIS-base2026.06 | 32.6 | 37.9 | |
| DVtor (DeCLIP)Backbone=ViT-B/16, Training Data=LVIS-base2026.06 | 32.5 | 37.9 | |
| DVtor (CLIPSelf)Backbone=ViT-B/16, Training Data=LVIS-base2026.06 | 31.4 | 37.2 | |
| F-VLM (CLIP)Backbone=RN50×16, Training Data=LVIS-base2026.06 | 31.3 | 37.2 | |
| F-ViT (DeCLIP)Backbone=ViT-B/16, Training Data=LVIS-base2026.06 | 30.8 | 36.3 | |
| F-ViT (CLIPSelf)Backbone=ViT-B/16, Training Data=LVIS-base2026.06 | 29.8 | 35.6 |