Object Detection on COCO-O
59.1APObjEmbed-2B
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| ObjEmbed-2Bparameters=2B2026.02 | 59.1 | — | — | |
| ObjEmbed-4Bparameters=4B2026.02 | 58 | — | — | |
| WeDetect-Ref-4Bparameters=4B2026.02 | 56 | — | — | |
| WeDetect-Ref-2Bparameters=2B2026.02 | 55.8 | — | — | |
| LLMDetBackbone=Swin-L, Resolution=1000*1560, #Params=343M, FPS=2.1, Zero-shot=true2025.12 | 53.2 | — | — | |
| DetCLIPv3Backbone=Swin-L, Include COCO data into training=false2024.04 | 48.8 | 27 | — | |
| DetCLIPv3Backbone=Swin-L, Resolution=800*1333, Zero-shot=true2025.12 | 48.8 | — | — | |
| GLIPBackbone=Swin-L, Include COCO data into training=true2024.04 | 48 | 24.9 | — | |
| WeDetect-LargeBackbone=ConvNext-L, Resolution=1280*1280, #Params=490M, FPS=6, Zero-shot=true2025.12 | 47 | — | — | |
| Qwen3-VL-4Bparameters=4B2026.02 | 44.4 | — | — | |
| WeDetect-Bscale=Base2026.02 | 44.1 | — | — | |
| WeDetect-BaseBackbone=ConvNext-B, Resolution=640*640, #Params=176M, FPS=35.1, Zero-shot=true2025.12 | 44.1 | — | — | |
| GRITBackbone=ViT-H, Include COCO data into training=true2024.04 | 42.9 | 15.7 | — | |
| OWLv2 (L/14)backbone=L/142026.02 | 42.7 | — | — | |
| DINOBackbone=Swin-L, Include COCO data into training=true2024.04 | 42.1 | 15.8 | — | |
| WeDetect-TinyBackbone=ConvNext-T, Resolution=640*640, #Params=33M, FPS=62.5, Zero-shot=true2025.12 | 38.6 | — | — | |
| DetCLIPv3Backbone=Swin-T, Include COCO data into training=false2024.04 | 38.5 | 17.3 | — | |
| DetCLIPv3Backbone=Swin-T, Including COCO data in training=true, Zero-shot=true2025.01 | 38.5 | 17.3 | — | |
| DetCLIPv3Backbone=Swin-T, Resolution=800*1333, Zero-shot=true2025.12 | 38.5 | — | — | |
| Grounding-DINOBackbone=Swin-T, Including COCO data in training=true, Zero-shot=true2025.01 | 37.6 | 15.8 | — | |
| Grounding-DINO-Tscale=Tiny2026.02 | 37.6 | — | — | |
| Grounding-DINOBackbone=Swin-T, Resolution=800*1333, #Params=172M, FPS=6, Zero-shot=true2025.12 | 37.6 | — | — | |
| LLMDetBackbone=Swin-T, Including COCO data in training=true, Zero-shot=true2025.01 | 36.1 | 11.1 | — | |
| LLMDet-Tscale=Tiny2026.02 | 36.1 | — | — | |
| LLMDetBackbone=Swin-T, Resolution=800*1333, #Params=172M, FPS=6, Zero-shot=true2025.12 | 36.1 | — | — | |
| DyHeadBackbone=Swin-L, Include COCO data into training=true2024.04 | 35.3 | 10 | — | |
| MM-GDINOBackbone=Swin-T, Including COCO data in training=true, Zero-shot=true2025.01 | 34 | 11.3 | — | |
| MM-GDINOBackbone=Swin-T, Resolution=800*1333, #Params=172M, FPS=6, Zero-shot=true2025.12 | 34 | — | — | |
| YOLO-World-LBackbone=YOLOv8-L, Resolution=640*640, #Params=48M, FPS=54.6, Zero-shot=true2025.12 | 32.5 | — | — | |
| Qwen3-VL-2Bparameters=2B2026.02 | 29.4 | — | — | |
| GLIPBackbone=Swin-T, Include COCO data into training=true2024.04 | 29 | 8 | — | |
| GLIPBackbone=Swin-T, Including COCO data in training=true, Zero-shot=true2025.01 | 29 | 8 | — | |
| GLIP-Tscale=Tiny2026.02 | 29 | — | — | |
| GLIPBackbone=Swin-T, Resolution=800*1333, #Params=232M, FPS=5.4, Zero-shot=true2025.12 | 29 | — | — | |
| DINOBackbone=R50, Including COCO data in training=true, Zero-shot=true2025.01 | 22.5 | 0.5 | — | |
| gDino-T2025.11 | — | — | 35.3 | |
| LLMDet-L2025.11 | — | — | 49.8 | |
| OWLv22025.11 | — | — | 42.4 | |
| OWLv2*training=partially trained on LVIS2025.11 | — | — | 23.9 | |
| SAM 32025.11 | — | — | 55.7 |