Object Detection on LVIS base categories v1.0 (minival5k train)
60.5AP (All)DetCLIPv3
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| DetCLIPv3Backbone=Swin-L, Fine-tuning protocol=base categories only2024.04 | 60.5 | 60.3 | |
| OWL-ST+FTBackbone=CLIP L/14, Fine-tuning protocol=base categories only2024.04 | 56.2 | 52.3 | |
| DetCLIPv3Backbone=Swin-T, Fine-tuning protocol=base categories only2024.04 | 54.3 | 53.7 | |
| OWL-ST+FTBackbone=CLIP B/16, Fine-tuning protocol=base categories only2024.04 | 48.7 | 42.1 |