Bounding-box classification on LVIS
38.3Top-1 AccuracyFG-CLIP
Evaluation Results
| Method | Links | |
|---|---|---|
| FG-CLIPBackbone=ViT-L/14, Zero-shot=true, Data enhancement=true2025.11 | 38.3 | |
| FG-CLIPBackbone=ViT-B/16, Zero-shot=true, Data enhancement=true2025.11 | 28.6 | |
| FG-CLIPBackbone=ViT-B/16, Data Enhancement=true2025.11 | 28.6 | |
| HarmoCLIPBackbone=ViT-L/14, Zero-shot=true, Data enhancement=false2025.11 | 24.47 | |
| FineCLIPBackbone=ViT-B/16, Zero-shot=true, Data enhancement=true2025.11 | 23.3 | |
| FineCLIPBackbone=ViT-B/16, Data Enhancement=true2025.11 | 23.3 | |
| FineCLIPBackbone=ViT-L/14, Zero-shot=true, Data enhancement=true2025.11 | 22.5 | |
| RegionCLIPBackbone=ViT-B/16, Zero-shot=true, Data enhancement=false2025.11 | 22.2 | |
| HarmoCLIPBackbone=ViT-B/16, Zero-shot=true, Data enhancement=false2025.11 | 22.2 | |
| RegionCLIPBackbone=RN50, Data Enhancement=false2025.11 | 22.2 | |
| HarmoCLIPBackbone=ViT-B/16, Data Enhancement=false2025.11 | 22.2 | |
| CLIPBackbone=ViT-B/16, Zero-shot=true, Data enhancement=false2025.11 | 20.9 | |
| CLIPBackbone=ViT-B/16, Data Enhancement=false2025.11 | 20.9 | |
| EVA-CLIPBackbone=ViT-L/14, Zero-shot=true, Data enhancement=false2025.11 | 18.3 | |
| EVA-CLIPBackbone=ViT-B/16, Zero-shot=true, Data enhancement=false2025.11 | 14.4 | |
| EVA-CLIPBackbone=ViT-B/16, Data Enhancement=false2025.11 | 14.4 | |
| CLIPBackbone=ViT-L/14, Zero-shot=true, Data enhancement=false2025.11 | 9.3 | |
| CLIPSelfBackbone=ViT-B/16, Zero-shot=true, Data enhancement=false2025.11 | 7.8 | |
| CLIPSelfBackbone=ViT-B/16, Data Enhancement=false2025.11 | 7.8 |