Object Detection on COCO 2017
62.6AP (Box)Grounding-DINO-L
Evaluation Results
| Method | Links | |||||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Grounding-DINO-LPre-train Data=O365+COCO+OI+Gold+Cap4M+RefC, Evaluation Protocol=Fine-Tuned2026.01 | 62.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Grounding-DINO-LPre-train Data=O365+COCO+OI+Gold+Cap4M+RefC, Evaluation Protocol=Zero-Shot2026.01 | 60.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FIBER-BPre-train Data=O365+COCO+CC+SBU+VG, Evaluation Protocol=Fine-Tuned2026.01 | 58.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VLDet-LPre-train Data=O365, Evaluation Protocol=Fine-Tuned2026.01 | 55.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VLDet-BPre-train Data=O365, Evaluation Protocol=Fine-Tuned2026.01 | 54.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GLIP-TPre-train Data=O365+Gold, Evaluation Protocol=Fine-Tuned2026.01 | 53.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MaxViT-BResolution=896x896, Pre-trained=ImageNet-1K, FLOPs=856G, Pars.=157M2022.04 | 53.4 | 72.9 | 58.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| YOLOv11-LPre-train Data=-, Evaluation Protocol=Fine-Tuned2026.01 | 53.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| YOLO-World-LPre-train Data=O365+Gold+CC, Evaluation Protocol=Fine-Tuned2026.01 | 53.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MaxViT-SResolution=896x896, Pre-trained=ImageNet-1K, FLOPs=595G, Pars.=107M2022.04 | 53.1 | 72.5 | 58.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ConvNeXt-BResolution=1280x800, Pre-trained=ImageNet-1K, FLOPs=964G2022.04 | 52.7 | 71.3 | 57.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| As-ViT-LResolution=1024x1024, Pre-trained=ImageNet-1K, FLOPs=1094G, Pars.=139M2022.04 | 52.7 | 72.3 | 57.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| UVIT-BResolution=896x896, Pre-trained=ImageNet-1K, FLOPs=975G, Pars.=74M2022.04 | 52.5 | 72 | 57.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Swin-S-DCT-KParam (M)=107, DCT-based initialization=true2024.05 | 52.4 | 70.8 | 57.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MaxViT-TResolution=896x896, Pre-trained=ImageNet-1K, FLOPs=475G, Pars.=69M2022.04 | 52.1 | 71.9 | 56.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Swin-S-DCT-0.75Param (M)=102, Compression Ratio=0.752024.05 | 52.1 | 70.6 | 57 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VanillaResolution=1024, Backbone=ViT-B, Detection Model=ViTDeT [32], Pre-training=ImageNet-1K via MAE [36]2024.05 | 52 | 72 | 57 | 35 | 56 | 66 | — | — | — | — | — | — | — | — | — | — | — | |
| ConvNeXt-SResolution=1280x800, Pre-trained=ImageNet-1K, FLOPs=827G2022.04 | 51.9 | 70.8 | 56.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Swin-SResolution=1280x800, Pre-trained=ImageNet-1K, FLOPs=838G, Pars.=107M2022.04 | 51.9 | 70.7 | 56.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Swin-BResolution=1280x800, Pre-trained=ImageNet-1K, FLOPs=982G, Pars.=145M2022.04 | 51.9 | 70.5 | 56.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Swin-SParam (M)=1072024.05 | 51.8 | 70.4 | 56.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| TransNeXt-BaseBackbone=TransNeXt-Base, Token Mixing Type=Conv + Attn, Param (M)=109, MACs (G)=728, Framework=Mask R-CNN, Training Schedule=1x2024.05 | 51.7 | 73.2 | 56.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VisformerV2-SFramework=Cascade Mask R-CNN, Schedule=3x + MS, FLOPs=740G, Params=81M, FPS=9.62021.04 | 51.6 | 70.1 | 56.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ViTDet-BPre-train Data=IN1K, Evaluation Protocol=Fine-Tuned2026.01 | 51.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| UVIT-SResolution=896x896, Pre-trained=ImageNet-1K, FLOPs=744G, Pars.=54M2022.04 | 51.4 | 70.8 | 56.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| YOLO-World-MPre-train Data=O365+Gold, Evaluation Protocol=Fine-Tuned2026.01 | 51.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PVTv2-B2Framework=Cascade Mask R-CNN, Schedule=3x + MS, FLOPs=788G, Params=83M, FPS=7.12021.04 | 51.1 | 69.8 | 55.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| UVIT-TResolution=896x896, Pre-trained=ImageNet-1K, FLOPs=613G, Pars.=47M2022.04 | 51.1 | 70.4 | 56.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| TransNeXt-SmallBackbone=TransNeXt-Small, Token Mixing Type=Conv + Attn, Param (M)=69, MACs (G)=516, Framework=Mask R-CNN, Training Schedule=1x2024.05 | 51.1 | 72.6 | 56.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PVTv2-B2-LiFramework=Cascade Mask R-CNN, Schedule=3x + MS, FLOPs=725G, Params=80M, FPS=8.22021.04 | 50.9 | 69.5 | 55.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Swin-TFramework=Cascade Mask R-CNN, Schedule=3x + MS, FLOPs=745G, Params=86M, FPS=9.52021.04 | 50.5 | 69.3 | 54.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ConvNeXt-TResolution=1280x800, Pre-trained=ImageNet-1K, FLOPs=741G2022.04 | 50.4 | 69.1 | 54.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Swin-TResolution=1280x800, Pre-trained=ImageNet-1K, FLOPs=745G, Pars.=86M2022.04 | 50.4 | 69.2 | 54.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Swin-T-DCT-KParam (M)=86, DCT-based initialization=true2024.05 | 50.4 | 69.2 | 54.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MSG-TFramework=Cascade Mask R-CNN, Schedule=3x + MS, FLOPs=758G, Params=86M, FPS=9.52021.04 | 50.3 | 69 | 54.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Swin-TParam (M)=862024.05 | 50.3 | 69.1 | 54.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DeiT-BBackbone=DeiT-B, Detector Head=Cascade Mask R-CNN, Input Resolution=1024x1024, #Param.=141M, OPs=1041G2026.03 | 50.21 | 68.63 | 54.53 | 33.29 | 53.43 | 65.56 | — | — | — | — | — | — | — | — | — | — | — | |
| DeiT-BBackbone=DeiT-B, Detector Head=Cascade Mask R-CNN, Input Resolution=1024x1024, #Param.=141M, OPs=1041G2026.03 | 50.21 | 68.63 | 54.53 | 33.29 | 53.43 | 65.56 | — | — | — | — | — | — | — | — | — | — | — | |
| SageAttention-BBackbone=SageAttention-B, Detector Head=Cascade Mask R-CNN, Input Resolution=1024x1024, #Param.=141M, OPs=999G2026.03 | 50.2 | 68.62 | 54.55 | 33.29 | 53.39 | 65.58 | — | — | — | — | — | — | — | — | — | — | — | |
| SageAttention-BBackbone=SageAttention-B, Detector Head=Cascade Mask R-CNN, Input Resolution=1024x1024, #Param.=141M, OPs=999G2026.03 | 50.2 | 68.62 | 54.55 | 33.29 | 53.39 | 65.58 | — | — | — | — | — | — | — | — | — | — | — | |
| BinaryAttention-BBackbone=BinaryAttention-B, Detector Head=Cascade Mask R-CNN, Input Resolution=1024x1024, #Param.=141M, OPs=941G2026.03 | 50.16 | 68.8 | 54.09 | 32.9 | 53.31 | 66.26 | — | — | — | — | — | — | — | — | — | — | — | |
| BinaryAttention-BBackbone=BinaryAttention-B, Detector Head=Cascade Mask R-CNN, Input Resolution=1024x1024, #Param.=141M, OPs=941G2026.03 | 50.16 | 68.8 | 54.09 | 32.9 | 53.31 | 66.26 | — | — | — | — | — | — | — | — | — | — | — | |
| Swin-T-DCT-0.75Param (M)=83, Compression Ratio=0.752024.05 | 50 | 69.1 | 53.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| TransNeXt-TinyBackbone=TransNeXt-Tiny, Token Mixing Type=Conv + Attn, Param (M)=48, MACs (G)=356, Framework=Mask R-CNN, Training Schedule=1x2024.05 | 49.9 | 71.5 | 54.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| BinaryAttention-SBackbone=BinaryAttention-S, Detector Head=Cascade Mask R-CNN, Input Resolution=1024x1024, #Param.=75M, OPs=647G2026.03 | 49.63 | 68 | 53.65 | 32.83 | 53 | 65.7 | — | — | — | — | — | — | — | — | — | — | — | |
| BinaryAttention-SBackbone=BinaryAttention-S, Detector Head=Cascade Mask R-CNN, Input Resolution=1024x1024, #Param.=75M, OPs=647G2026.03 | 49.63 | 68 | 53.65 | 32.83 | 53 | 65.7 | — | — | — | — | — | — | — | — | — | — | — | |
| AdaRouteBackbone=ConvNeXt-L, # P (M)=9.22026.02 | 49.5 | 71.9 | 54.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SageAttention-SBackbone=SageAttention-S, Detector Head=Cascade Mask R-CNN, Input Resolution=1024x1024, #Param.=75M, OPs=675G2026.03 | 49.46 | 68.16 | 53.2 | 32.07 | 53.22 | 65.14 | — | — | — | — | — | — | — | — | — | — | — | |
| SageAttention-SBackbone=SageAttention-S, Detector Head=Cascade Mask R-CNN, Input Resolution=1024x1024, #Param.=75M, OPs=675G2026.03 | 49.46 | 68.16 | 53.2 | 32.07 | 53.22 | 65.14 | — | — | — | — | — | — | — | — | — | — | — | |
| DeiT-SBackbone=DeiT-S, Detector Head=Cascade Mask R-CNN, Input Resolution=1024x1024, #Param.=75M, OPs=696G2026.03 | 49.44 | 68.1 | 53.16 | 32.01 | 53.2 | 65.18 | — | — | — | — | — | — | — | — | — | — | — | |
| DeiT-SBackbone=DeiT-S, Detector Head=Cascade Mask R-CNN, Input Resolution=1024x1024, #Param.=75M, OPs=696G2026.03 | 49.44 | 68.1 | 53.16 | 32.01 | 53.2 | 65.18 | — | — | — | — | — | — | — | — | — | — | — | |
| VisformerV2-SFramework=Cascade Mask R-CNN, Schedule=1x + MS, FLOPs=740G, Params=81M, FPS=9.62021.04 | 49.3 | 68.1 | 53.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FIBER-BPre-train Data=O365+COCO+CC+SBU+VG, Evaluation Protocol=Zero-Shot2026.01 | 49.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VMamba-B†Backbone=VMamba-B†, Token Mixing Type=Conv + SSM, Param (M)=108, MACs (G)=485, Framework=Mask R-CNN, Training Schedule=1x2024.05 | 49.2 | 70.9 | 53.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FocalNet-BBackbone=FocalNet-B, Token Mixing Type=Conv, Param (M)=111, MACs (G)=507, Framework=Mask R-CNN, Training Schedule=1x2024.05 | 49 | 70.9 | 53.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MonaBackbone=ConvNeXt-L, # P (M)=9.12026.02 | 48.9 | 71.4 | 53.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| vHeat-SFramework=Mask R-CNN, Schedule=3x MS, Input size=1280x800, FPS (images/s)=25.9, FLOPS=348G2024.05 | 48.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VMamba-S†Backbone=VMamba-S†, Token Mixing Type=Conv + SSM, Param (M)=64, MACs (G)=357, Framework=Mask R-CNN, Training Schedule=1x2024.05 | 48.7 | 70 | 53.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CSWin-BBackbone=CSWin-B, Token Mixing Type=Attn, Param (M)=97, MACs (G)=526, Framework=Mask R-CNN, Training Schedule=1x2024.05 | 48.7 | 70.4 | 53.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Full-tuningBackbone=Swin-L, # P (M)=1952026.02 | 48.6 | 70.9 | 53.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| AdaRouteBackbone=Swin-L, # P (M)=7.32026.02 | 48.6 | 71.1 | 53.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VMamba-BBackbone=VMamba-B, Token Mixing Type=Conv + SSM, Param (M)=96, MACs (G)=540, Framework=Mask R-CNN, Training Schedule=1x2024.05 | 48.5 | 69.6 | 53 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LocalVMamba-SBackbone=LocalVMamba-S, Token Mixing Type=Conv + SSM, Param (M)=69, MACs (G)=414, Framework=Mask R-CNN, Training Schedule=1x2024.05 | 48.4 | 69.9 | 52.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| X101-64Resolution=1280x800, Pre-trained=ImageNet-1K, FLOPs=972G, Pars.=140M2022.04 | 48.3 | 66.4 | 52.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FocalNet-SBackbone=FocalNet-S, Token Mixing Type=Conv, Param (M)=72, MACs (G)=365, Framework=Mask R-CNN, Training Schedule=1x2024.05 | 48.3 | 70.5 | 53.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| BinaryAttention-BBackbone=BinaryAttention-B, Detector=Mask R-CNN, Input Resolution=1024x1024, #Param.=111M, OPs=685G2026.03 | 48.28 | — | — | 31.96 | 51.68 | 63.44 | — | 69.98 | 52.58 | — | — | — | — | — | — | — | — | |
| SG-Former-MBackbone=SG-Former-M, Token Mixing Type=Conv + Attn, Param (M)=51, Framework=Mask R-CNN, Training Schedule=1x2024.05 | 48.2 | 70.3 | 53.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VMamba-SBackbone=VMamba-S, Token Mixing Type=Conv + SSM, Param (M)=64, MACs (G)=400, Framework=Mask R-CNN, Training Schedule=1x2024.05 | 48.2 | 69.7 | 52.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Swin-SFramework=Mask R-CNN, Schedule=3x MS, Input size=1280x800, FPS (images/s)=19.7, FLOPS=359G2024.05 | 48.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Swin-TFramework=Cascade Mask R-CNN, Schedule=1x + MS, FLOPs=745G, Params=86M, FPS=9.52021.04 | 48.1 | 67.1 | 52.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| X101-32Resolution=1280x800, Pre-trained=ImageNet-1K, FLOPs=819G, Pars.=101M2022.04 | 48.1 | 66.5 | 52.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MonaBackbone=Swin-L, # P (M)=7.52026.02 | 48.1 | 71.3 | 52.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Full-tuningBackbone=ConvNeXt-L, # P (M)=196.22026.02 | 48.1 | 69.7 | 53.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DeiT-SFramework=Cascade Mask R-CNN, Schedule=3x + MS, FLOPs=889G, Params=80M2021.04 | 48 | 67.2 | 51.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| AdaRouteBackbone=ConvNeXt-B, # P (M)=6.52026.02 | 48 | 70.2 | 52.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DeiT-BBackbone=DeiT-B, Detector=Mask R-CNN, Input Resolution=1024x1024, #Param.=111M, OPs=785G2026.03 | 47.99 | — | — | 31.59 | 51.11 | 64.04 | — | 69.46 | 52.07 | — | — | — | — | — | — | — | — | |
| SageAttention-BBackbone=SageAttention-B, Detector=Mask R-CNN, Input Resolution=1024x1024, #Param.=111M, OPs=742G2026.03 | 47.97 | — | — | 31.64 | 51.13 | 63.97 | — | 69.46 | 52.08 | — | — | — | — | — | — | — | — | |
| CSWin-SBackbone=CSWin-S, Token Mixing Type=Attn, Param (M)=54, MACs (G)=342, Framework=Mask R-CNN, Training Schedule=1x2024.05 | 47.9 | 70.1 | 52.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ConvNeXt-SFramework=Mask R-CNN, Schedule=3x MS, Input size=1280x800, FPS (images/s)=20.2, FLOPS=349G2024.05 | 47.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CoLoRABackbone=ConvNeXt-L, # P (M)=9.42026.02 | 47.9 | 70.7 | 52.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VisformerV2-SFramework=Mask R-CNN, Schedule=3x + MS, FLOPs=262G, Params=43M, FPS=15.22021.04 | 47.8 | 69.5 | 52.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Full-tuningBackbone=ConvNeXt-B, # P (M)=87.62026.02 | 47.8 | 69.7 | 52.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| TCP-Vim-T1#Param.=60.4M, SSM FLOPs=6.14G (↓ 40.6%)2026.05 | 47.8 | 64.2 | 52.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| vHeat-BFramework=Mask R-CNN, Schedule=1x, Input size=1280x800, FPS (images/s)=20.2, FLOPS=432G2024.05 | 47.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Full-tuningBackbone=Swin-B, # P (M)=86.82026.02 | 47.5 | 69.8 | 52.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MonaBackbone=ConvNeXt-B, # P (M)=6.52026.02 | 47.5 | 70 | 52.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SoLA-BFLOPs=403.0G, Params=88.26M, Input resolution=1333 x 800, Framework=Mask R-CNN, Schedule=1x2026.01 | 47.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SG-Former-SBackbone=SG-Former-S, Token Mixing Type=Conv + Attn, Param (M)=41, Framework=Mask R-CNN, Training Schedule=1x2024.05 | 47.4 | 69 | 52 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VMamba-T†Backbone=VMamba-T†, Token Mixing Type=Conv + SSM, Param (M)=50, MACs (G)=270, Framework=Mask R-CNN, Training Schedule=1x2024.05 | 47.4 | 69.5 | 52 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MambaOut-SmallBackbone=MambaOut-Small, Token Mixing Type=Conv, Param (M)=65, MACs (G)=354, Framework=Mask R-CNN, Training Schedule=1x2024.05 | 47.4 | 69.1 | 52.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PVTv2-B5Backbone=PVTv2-B5, Token Mixing Type=Conv + Attn, Param (M)=102, MACs (G)=557, Framework=Mask R-CNN, Training Schedule=1x2024.05 | 47.4 | 68.6 | 51.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MambaOut-BaseBackbone=MambaOut-Base, Token Mixing Type=Conv, Param (M)=100, MACs (G)=495, Framework=Mask R-CNN, Training Schedule=1x2024.05 | 47.4 | 69.3 | 52.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CoLoRABackbone=ConvNeXt-B, # P (M)=6.42026.02 | 47.4 | 69.9 | 52.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| QuadTree-B3Framework=RetinaNet, Schedule=1x2023.03 | 47.3 | 68.2 | 50.6 | 30.4 | 51.3 | 62.9 | — | — | — | — | — | — | — | — | — | — | — | |
| QuadTree-B3Framework=RetinaNet, Training Schedule=1x2024.10 | 47.3 | 68.2 | 50.6 | 30.4 | 51.3 | 62.9 | — | — | — | — | — | — | — | — | — | — | — | |
| AdaRouteBackbone=Swin-B, # P (M)=5.22026.02 | 47.3 | 70 | 51.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LoRABackbone=ConvNeXt-L, # P (M)=8.82026.02 | 47.3 | 70.5 | 52.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Wave-ViT-B*Framework=RetinaNet, Schedule=1x2023.03 | 47.2 | 68.2 | 50.9 | 29.7 | 51.4 | 62.3 | — | — | — | — | — | — | — | — | — | — | — | |
| vHeat-TFramework=Mask R-CNN, Schedule=3x MS, Input size=1280x800, FPS (images/s)=32.7, FLOPS=272G2024.05 | 47.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| BiFormer-BFramework=RetinaNet, Schedule=1x2023.03 | 47.1 | 68.5 | 50.4 | 31.3 | 50.8 | 62.6 | — | — | — | — | — | — | — | — | — | — | — |