Instance Segmentation on ADE20K 150 classes (val)
41.24APOsprey-7B
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Osprey-7BType=Mask2023.12 | 41.24 | — | |
| CLIP-ConvNeXt-LType=Mask2023.12 | 39.38 | — | |
| OneFormerBackbone=Swin-L, Pretraining=ImageNet-22K, #Params=219M, #FLOPs=1597G, #Queries=250, Crop Size=1280x1280, Iters=160k, Training Strategy=Joint Training2022.11 | 37.8 | — | |
| OneFormerBackbone=Swin-L, Pretraining=ImageNet-22K, #Params=219M, #FLOPs=801G, #Queries=250, Crop Size=896x896, Iters=160k, Training Strategy=Joint Training2022.11 | 37.6 | — | |
| OneFormerBackbone=DINAT-L, Pretraining=ImageNet-22K, #Params=223M, #FLOPs=1369G, #Queries=250, Crop Size=1280x1280, Iters=160k, Training Strategy=Joint Training2022.11 | 37.1 | — | |
| OneFormerBackbone=DINAT-L, Pretraining=ImageNet-22K, #Params=223M, #FLOPs=678G, #Queries=250, Crop Size=896x896, Iters=160k, Training Strategy=Joint Training2022.11 | 36.8 | — | |
| OneFormerBackbone=ConvNeXt-XL, #Params=372M, #FLOPs=607G, #Queries=250, Crop Size=640x640, Iters=160k, Training Strategy=Joint Training2022.11 | 36.3 | — | |
| OneFormerBackbone=ConvNeXt-L, Pretraining=ImageNet-22K, #Params=220M, #FLOPs=389G, #Queries=250, Crop Size=640x640, Iters=160k, Training Strategy=Joint Training2022.11 | 36.2 | — | |
| OneFormerBackbone=DINAT-L, #Params=223M, #FLOPs=359G, #Queries=250, Crop Size=640x640, Iters=160k, Training Strategy=Joint Training2022.11 | 36 | — | |
| OneFormerBackbone=Swin-L, Pretraining=ImageNet-22K, #Params=219M, #FLOPs=436G, #Queries=250, Crop Size=640x640, Iters=160k, Training Strategy=Joint Training2022.11 | 35.9 | — | |
| Mask2Former-InstanceBackbone=Swin-L, #Params=216M, #FLOPs=411G, #Queries=200, Crop Size=640x640, Iters=160k, Training Strategy=Individual Training2022.11 | 34.9 | — | |
| Mask2Former-PanopticBackbone=Swin-L, Pretraining=ImageNet-22K, Confidence Threshold=0.5, #Params=216M, #FLOPs=413G, #Queries=200, Crop Size=640x640, Iters=160k, Training Strategy=Individual Training2022.11 | 34.2 | — | |
| Ferret-7BType=Mask2023.12 | 29.93 | — | |
| CLIP-Surgery-ViT-LType=Mask2023.12 | 29.7 | — | |
| CLIP-Surgery-ViT-LBackbone=ViT-L2023.07 | 29.7 | — | |
| GPT4RoI-7BType=Box2023.12 | 26.08 | — | |
| GPT4RoI-7BModel size=7B2023.07 | 26.08 | — | |
| Shikra-7BType=Box2023.12 | 20.35 | — | |
| Shikra-7BConcurrent work=true, Model size=7B2023.07 | 20.35 | — | |
| MaskCLIP++mask generator=FC-CLIP2024.12 | 17.3 | — | |
| FC-CLIP2024.12 | 16.8 | — | |
| ODISE2024.03 | 14.4 | — | |
| ODISE2024.12 | 14.4 | — | |
| PSALMzero-shot=true, additional_training_data=LVIS2024.03 | 13.9 | — | |
| SAN2024.03 | 10.6 | — | |
| PSALMzero-shot=true2024.03 | 9 | — | |
| MaskCLIP2024.12 | 6.2 | — | |
| MaskCLIP2024.03 | 6 | — | |
| Kosmos-2Type=Box2023.12 | 4.33 | — | |
| Kosmos-2Concurrent work=true2023.07 | 4.33 | — | |
| APE (A)Backbone=ViT-L2023.12 | — | 23.8 | |
| APE (B)Backbone=ViT-L2023.12 | — | 23.5 | |
| APE (C)Backbone=ViT-L2023.12 | — | 23.8 | |
| APE (D)Backbone=ViT-L2023.12 | — | 24.4 | |
| OpenSeeDBackbone=Swin-L2023.12 | — | 15 | |
| X-DecoderBackbone=DaViT-L2023.12 | — | 13.1 |