Object Detection on Pascal VOC (test)
87.5mAPCoLin
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| CoLinBackbone=Swin-L, Architecture=RetinaNet, Trained Params=2.39 M, Percentage of trainable backbone parameters=1.23 %, Extra Structure=true2026.02 | 87.5 | — | — | 3.8 | |
| LORANDBackbone=Swin-L, Architecture=RetinaNet, Trained Params=5.20 M, Percentage of trainable backbone parameters=2.62 %, Extra Structure=true2026.02 | 86.9 | — | — | 3.2 | |
| ADAPTERBackbone=Swin-L, Architecture=RetinaNet, Trained Params=4.61 M, Percentage of trainable backbone parameters=2.33 %, Extra Structure=true2026.02 | 86.7 | — | — | 3 | |
| ADAPTFORMERBackbone=Swin-L, Architecture=RetinaNet, Trained Params=2.34 M, Percentage of trainable backbone parameters=1.18 %, Extra Structure=true2026.02 | 86.6 | — | — | 2.9 | |
| NORMTUNINGBackbone=Swin-L, Architecture=RetinaNet, Trained Params=0.10 M, Percentage of trainable backbone parameters=0.05 %, Extra Structure=false2026.02 | 85.5 | — | — | 1.8 | |
| PARTIAL-1Backbone=Swin-L, Architecture=RetinaNet, Trained Params=28.77 M, Percentage of trainable backbone parameters=14.53 %, Extra Structure=false2026.02 | 85.5 | — | — | 1.8 | |
| BITFITBackbone=Swin-L, Architecture=RetinaNet, Trained Params=0.30 M, Percentage of trainable backbone parameters=0.15 %, Extra Structure=false2026.02 | 85.4 | — | — | 1.7 | |
| LORABackbone=Swin-L, Architecture=RetinaNet, Trained Params=4.57 M, Percentage of trainable backbone parameters=2.31 %, Extra Structure=true2026.02 | 85.4 | — | — | 1.7 | |
| FIXEDBackbone=Swin-L, Architecture=RetinaNet, Trained Params=0.00 M, Percentage of trainable backbone parameters=0.00 %, Extra Structure=false2026.02 | 83.8 | — | — | 0.1 | |
| FULLBackbone=Swin-L, Architecture=RetinaNet, Trained Params=198.58 M, Percentage of trainable backbone parameters=100.00 %, Extra Structure=false2026.02 | 83.7 | — | — | — | |
| FR-DETRApproach=Our, Params(M)=23.28, GFlops=96.04, FPS=31.92026.06 | 77.99 | 82.58 | 66.66 | — | |
| CPAApproach=Union, Params(M)=23.94, GFlops=217.91, FPS=13.22026.06 | 77.61 | 82.43 | 65.89 | — | |
| DENetApproach=Union, Params(M)=20.13, GFlops=65.33, FPS=45.02026.06 | 77.5 | 82.1 | 65.74 | — | |
| MGDIPApproach=Union, Params(M)=26.90, GFlops=116.45, FPS=8.12026.06 | 77.34 | 81.9 | 65.67 | — | |
| RT-DETRApproach=Direct, Params(M)=20.09, GFlops=61.12, FPS=54.12026.06 | 76.9 | 81.66 | 64.85 | — | |
| FPBackbone=ResNet-34, Resolution=300, FLOPs=68502019.09 | 75.5 | — | — | — | |
| FPBackbone=VGG-16, Resolution=300, FLOPs=299862019.09 | 74.3 | — | — | — | |
| BBGBackbone=VGG-16, Resolution=300, FLOPs=10622019.09 | 68.5 | — | — | — | |
| BDNBackbone=DenseNet-45, Resolution=512, FLOPs=19602019.09 | 68.2 | — | — | — | |
| BDNBackbone=DenseNet-37, Resolution=512, FLOPs=15302019.09 | 66.4 | — | — | — | |
| BBGBackbone=ResNet-34, Resolution=300, FLOPs=3622019.09 | 62.8 | — | — | — | |
| TBNBackbone=ResNet-34, Resolution=300, FLOPs=4642019.09 | 59.5 | — | — | — | |
| XNORBackbone=ResNet-34, Resolution=300, FLOPs=3622019.09 | 55.1 | — | — | — | |
| BARONTraining dataset=OV-LVIS, learnable prompt templates=true2024.06 | — | 76 | 58.2 | — | |
| DetProTraining dataset=OV-LVIS, Source=Reported from DetPro [4]2024.06 | — | 74.6 | 57.9 | — | |
| LBPTraining dataset=OV-LVIS, learnable prompt templates=true2024.06 | — | 76.1 | 58.4 | — | |
| SupervisedTraining dataset=Standard Supervised Labels2024.06 | — | 78.5 | 49 | — | |
| ViLDTraining dataset=OV-LVIS, Source=Reported from DetPro [4]2024.06 | — | 73.9 | 57.9 | — |