Video Segmentation on DAVIS
88.61J&F ScoreSAM2-Base+ (Reference)
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| SAM2-Base+ (Reference)Model=SAM2-Base+, Precision=FP2025.03 | 88.61 | — | — | — | |
| SAM2-Small (Reference)Model=SAM2-Small, Precision=FP2025.03 | 88.28 | — | — | — | |
| SAM2-Tiny (Reference)Model=SAM2-Tiny, Precision=FP2025.03 | 87.96 | — | — | — | |
| AHCQ-SAMModel=SAM2-Tiny, Precision=W6A62025.03 | 86.82 | — | — | — | |
| AHCQ-SAMModel=SAM2-Small, Precision=W6A62025.03 | 86.32 | — | — | — | |
| BRECQModel=SAM2-Tiny, Precision=W6A62025.03 | 86.2 | — | — | — | |
| QDropModel=SAM2-Tiny, Precision=W6A62025.03 | 86.18 | — | — | — | |
| PTQ4SAMModel=SAM2-Small, Precision=W6A62025.03 | 86.04 | — | — | — | |
| PTQ4SAMModel=SAM2-Tiny, Precision=W6A62025.03 | 85.94 | — | — | — | |
| QDropModel=SAM2-Small, Precision=W6A62025.03 | 85.94 | — | — | — | |
| BRECQModel=SAM2-Small, Precision=W6A62025.03 | 85.77 | — | — | — | |
| AHCQ-SAMModel=SAM2-Base+, Precision=W6A62025.03 | 83.69 | — | — | — | |
| QDropModel=SAM2-Base+, Precision=W6A62025.03 | 83.48 | — | — | — | |
| PTQ4SAMModel=SAM2-Base+, Precision=W6A62025.03 | 83.29 | — | — | — | |
| BRECQModel=SAM2-Base+, Precision=W6A62025.03 | 80.59 | — | — | — | |
| AHCQ-SAMModel=SAM2-Small, Precision=W4A42025.03 | 78.02 | — | — | — | |
| PTQ4SAMModel=SAM2-Small, Precision=W4A42025.03 | 76.67 | — | — | — | |
| QDropModel=SAM2-Small, Precision=W4A42025.03 | 74.07 | — | — | — | |
| AHCQ-SAMModel=SAM2-Tiny, Precision=W4A42025.03 | 71.94 | — | — | — | |
| VITOPretraining=Video pretraining, Pretraining Dataset=VideoNet2022.10 | 68.2 | — | — | — | |
| VFSPretraining=Video pretraining, Pretraining Dataset=K4002022.10 | 67.8 | — | — | — | |
| BRECQModel=SAM2-Small, Precision=W4A42025.03 | 66.97 | — | — | — | |
| BYOLPretraining=Standard image pretraining, Pretraining Dataset=ImageNet2022.10 | 66.6 | — | — | — | |
| MoCo + CC + A+ + kNNPre-training Dataset=COCO, Pre-training Epochs=800, Constrained multi-crop=true, Stronger augmentations=true, kNN nearest neighbors=true2021.06 | 66.2 | — | — | — | |
| SupervisedPretraining=Supervised, Pretraining Dataset=ImageNet2022.10 | 66.1 | — | — | — | |
| VINCEPretraining=Video pretraining, Pretraining Dataset=R2V22022.10 | 66.1 | — | — | — | |
| QDropModel=SAM2-Tiny, Precision=W4A42025.03 | 65.74 | — | — | — | |
| MoCo + CC + A+Pre-training Dataset=COCO, Pre-training Epochs=800, Constrained multi-crop=true, Stronger augmentations=true2021.06 | 65.7 | — | — | — | |
| MoCo + CCPre-training Dataset=COCO, Pre-training Epochs=800, Constrained multi-crop=true2021.06 | 65.5 | — | — | — | |
| MOCLRPretraining=Standard image pretraining, Pretraining Dataset=ImageNet2022.10 | 65.5 | — | — | — | |
| DINOPretraining=Standard image pretraining, Pretraining Dataset=ImageNet2022.10 | 65.3 | — | — | — | |
| MoCoPre-training Dataset=COCO, Pre-training Epochs=8002021.06 | 63.3 | — | — | — | |
| PTQ4SAMModel=SAM2-Tiny, Precision=W4A42025.03 | 63.09 | — | — | — | |
| DenseCLPre-training Dataset=COCO, Pre-training Epochs=8002021.06 | 61.8 | — | — | — | |
| VirTexPre-training Dataset=COCO captions2021.06 | 61.3 | — | — | — | |
| PhiNet v2Backbone=ViT-S/16, Pre-training=Kinetics-400, Pre-training Epochs=4002025.05 | 60.1 | — | 57.2 | 63 | |
| PhiNet v2Type=Non-contrastive, Architecture=ViT-S/16, Pre-training dataset=Kinetics-400, Pre-training epochs=4002025.05 | 60.1 | — | 57.2 | 63 | |
| BRECQModel=SAM2-Tiny, Precision=W4A42025.03 | 59.92 | — | — | — | |
| DinoType=Non-contrastive, Architecture=ViT-S/16, Pre-training dataset=Kinetics-400, Pre-training epochs=4002025.05 | 59.5 | — | 56.5 | 62.5 | |
| RSPBackbone=ViT-S/16, Pre-training=Kinetics-400, Pre-training Epochs=4002025.05 | 58.4 | — | 55.7 | 61.1 | |
| RSPType=Autoencoder, Architecture=ViT-S/16, Pre-training dataset=Kinetics-400, Pre-training epochs=4002025.05 | 58.4 | — | 55.7 | 61.1 | |
| SiamMAEType=Autoencoder, Architecture=ViT-S/16, Pre-training dataset=Kinetics-400, Pre-training epochs=4002025.05 | 58.1 | — | 56.6 | 59.6 | |
| MoCo v3Type=Contrastive, Architecture=ViT-S/16, Pre-training dataset=Kinetics-400, Pre-training epochs=4002025.05 | 57.7 | — | 54.6 | 60.8 | |
| CropMAEBackbone=ViT-S/16, Pre-training=Kinetics-400, Pre-training Epochs=4002025.05 | 57 | — | 54.8 | 59.3 | |
| CropMAEType=Autoencoder, Architecture=ViT-S/16, Pre-training dataset=Kinetics-400, Pre-training epochs=4002025.05 | 57 | — | 54.8 | 59.3 | |
| SimCLRType=Contrastive, Architecture=ViT-S/16, Pre-training dataset=Kinetics-400, Pre-training epochs=4002025.05 | 53.9 | — | 51.7 | 56.2 | |
| JEPA-like methodBackbone=ViT-S/16, Pre-training=Kinetics-400, Pre-training Epochs=4002025.05 | 53.8 | — | 51.2 | 56.4 | |
| MAEType=Autoencoder, Architecture=ViT-S/16, Pre-training dataset=Kinetics-400, Pre-training epochs=4002025.05 | 53.5 | — | 50.4 | 56.7 | |
| AHCQ-SAMModel=SAM2-Base+, Precision=W4A42025.03 | 31.44 | — | — | — | |
| QDropModel=SAM2-Base+, Precision=W4A42025.03 | 30.59 | — | — | — | |
| PTQ4SAMModel=SAM2-Base+, Precision=W4A42025.03 | 29.19 | — | — | — | |
| BRECQModel=SAM2-Base+, Precision=W4A42025.03 | 25.37 | — | — | — | |
| Rand. init.2021.06 | 10.8 | — | — | — | |
| LRTL2025.01 | — | 0.822 | — | — | |
| VideoCutLER2025.01 | — | 0.672 | — | — | |
| VideoSAUR2025.01 | — | 0.175 | — | — |