Video Object Segmentation on DAVIS 2017 (test-dev)
80.3Region J MeanJIMD
Evaluation Results
| Method | Links | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| JIMDBackbone=ResNet502024.09 | 80.3 | — | — | 87.4 | — | — | — | 83.9 | — | |
| ISVOSBL30K pre-training=false2024.09 | 79.3 | — | — | 86.2 | — | — | — | 82.8 | — | |
| BATMANIncludes YouTube-VOS in training=true, Resolution=480p2022.08 | 78.4 | — | — | 86.1 | — | — | — | 82.2 | — | |
| QDMNsynthetic training dataset=true2022.07 | 78.1 | — | — | 85.4 | — | — | — | 81.9 | — | |
| RPCMResolution=Full-resolution, External Training Datasets=false2021.12 | 77.6 | — | — | 84.3 | — | — | — | 81 | — | |
| XMemBL30K pre-training=false2024.09 | 77.4 | — | — | 84.5 | — | — | — | 81 | — | |
| RAVOS2022.07 | 77.1 | — | — | 84.5 | — | — | — | 80.8 | — | |
| DeAOT-LBackbone=ResNet502024.09 | 76.9 | — | — | 84.5 | — | — | — | 80.7 | — | |
| STCNMethod Identity=Ours + BL30K, M3, Pre-training=BL30K, Memory frequency=M3 (increased frequency)2021.06 | 76.3 | — | — | 83.5 | — | — | — | 79.9 | — | |
| STCN2022.07 | 76.3 | — | — | 83.5 | — | — | — | 79.9 | — | |
| STCN2024.09 | 76.3 | — | — | 83.5 | — | — | — | 79.9 | — | |
| AOST-LBackbone=ResNet502024.09 | 76.2 | — | — | 83.6 | — | — | — | 79.9 | — | |
| R50-AOT2022.07 | 75.9 | — | — | 83.3 | — | — | — | 79.6 | — | |
| AOTIncludes YouTube-VOS in training=true, Resolution=480p2022.08 | 75.9 | — | — | 83.3 | — | — | — | 79.6 | — | |
| AOT-LBackbone=ResNet502024.09 | 75.9 | — | — | 83.3 | — | — | — | 79.6 | — | |
| RPCMResolution=480p, External Training Datasets=false2021.12 | 75.8 | — | — | 82.6 | — | — | — | 79.2 | — | |
| RPCMVOS2022.07 | 75.8 | — | — | 82.6 | — | — | — | 79.2 | — | |
| RPCMVOSIncludes YouTube-VOS in training=true, Resolution=480p2022.08 | 75.8 | — | — | 82.6 | — | — | — | 79.2 | — | |
| AOT-L2022.07 | 75.3 | — | — | 82.3 | — | — | — | 78.8 | — | |
| MiVOS+Spatial cues=true, Pre-training=BL30K2021.06 | 74.9 | — | — | 82.2 | — | — | — | 78.6 | — | |
| MiVOSsynthetic training dataset=true2022.07 | 74.9 | — | — | 82.2 | — | — | — | 78.6 | — | |
| DMN-AOA2022.07 | 74.8 | — | — | 81.7 | — | — | — | 78.3 | — | |
| HMMNAdditional YouTube-VOS training=true2021.09 | 74.7 | — | — | 82.5 | — | — | — | 78.6 | — | |
| HMMNReference frames=Multiple, Resolution=480p, Training Data=DAVIS and YouTube-VOS2022.07 | 74.7 | — | — | 82.5 | — | — | — | 78.6 | — | |
| Ours-MFReference frames=Multiple, Resolution=480p, Training Data=DAVIS and YouTube-VOS2022.07 | 74.7 | — | — | 83.9 | — | — | — | 79.3 | — | |
| HMMN2022.07 | 74.7 | — | — | 82.5 | — | — | — | 78.6 | — | |
| HMMN2024.09 | 74.7 | — | — | 82.5 | — | — | — | 78.6 | — | |
| LCMTraining data=DAVIS + Youtube-VOS2021.04 | 74.4 | — | — | 81.8 | — | — | — | 78.1 | — | |
| CFBI+Evaluation resolution=600p, Spatial cues=true2021.06 | 74.4 | — | — | 81.6 | — | — | — | 78 | — | |
| LCMSpatial cues=true2021.06 | 74.4 | — | — | 81.8 | — | — | — | 78.1 | — | |
| LCMResolution=480p, External Training Datasets=false2021.12 | 74.4 | — | — | 81.8 | — | — | — | 78.1 | — | |
| LCMReference frames=Multiple, Resolution=480p, Training Data=DAVIS and YouTube-VOS2022.07 | 74.4 | — | — | 81.8 | — | — | — | 78.1 | — | |
| LCM2022.07 | 74.4 | — | — | 81.8 | — | — | — | 78.1 | — | |
| LCMIncludes YouTube-VOS in training=true, Resolution=480p2022.08 | 74.4 | — | — | 81.8 | — | — | — | 78.1 | — | |
| CFBI+2024.09 | 74.4 | — | — | 81.6 | — | — | — | 78 | — | |
| STCNMethod Identity=Ours + BL30K, Pre-training=BL30K2021.06 | 74.3 | — | — | 81.3 | — | — | — | 77.8 | — | |
| QDMNsynthetic training dataset=false2022.07 | 74.2 | — | — | 81.2 | — | — | — | 77.7 | — | |
| KMNonline-learning=false2020.07 | 74.1 | 77.2 | — | 80.3 | — | — | — | — | — | |
| KMNTraining data=DAVIS + Youtube-VOS2021.04 | 74.1 | — | — | 80.3 | — | — | — | 77.2 | — | |
| KMNAdditional YouTube-VOS training=true2021.09 | 74.1 | — | — | 80.3 | — | — | — | 77.2 | — | |
| KMNEvaluation resolution=600p, Spatial cues=true2021.06 | 74.1 | — | — | 80.3 | — | — | — | 77.2 | — | |
| KMN2022.07 | 74.1 | — | — | 80.3 | — | — | — | 77.2 | — | |
| KMN2022.07 | 74.1 | — | — | 80.3 | — | — | — | 77.2 | — | |
| KMNIncludes YouTube-VOS in training=true, Resolution=600p2022.08 | 74.1 | — | — | 80.3 | — | — | — | 77.2 | — | |
| KMN2024.09 | 74.1 | — | — | 80.3 | — | — | — | 77.2 | — | |
| Ours-Base FRReference frames=1&(t-1), Resolution=Full-resolution, Training Data=DAVIS and YouTube-VOS2022.07 | 73.6 | — | — | 81.3 | — | — | — | 77.5 | — | |
| STCNMethod Identity=Ours, M3, Memory frequency=M3 (increased frequency)2021.06 | 73.1 | — | — | 80 | — | — | — | 76.5 | — | |
| CFBIEvaluation resolution=600p, Spatial cues=true2021.06 | 73 | — | — | 80.1 | — | — | — | 76.6 | — | |
| TransVOSIncludes YouTube-VOS in training=true, Resolution=480p2022.08 | 73 | — | — | 80.9 | — | — | — | 76.9 | — | |
| STCNMethod Identity=Ours (Baseline)2021.06 | 72.7 | — | — | 79.6 | — | — | — | 76.1 | — | |
| MiVOSResolution=480p, External Training Datasets=true2021.12 | 72.7 | — | — | 80.2 | — | — | — | 76.5 | — | |
| MiVOSReference frames=Multiple, Resolution=480p, Training Data=DAVIS and YouTube-VOS2022.07 | 72.7 | — | — | 80.2 | — | — | — | 76.5 | — | |
| STCNReference frames=Multiple, Resolution=480p, Training Data=DAVIS and YouTube-VOS2022.07 | 72.7 | — | — | 79.6 | — | — | — | 76.1 | — | |
| STCN2022.07 | 72.7 | — | — | 79.6 | — | — | — | 76.1 | — | |
| STCNIncludes YouTube-VOS in training=true, Resolution=480p2022.08 | 72.7 | — | — | 79.6 | — | — | — | 76.1 | — | |
| MiVOSsynthetic training dataset=false2022.07 | 72.6 | — | — | 79.3 | — | — | — | 76 | — | |
| Ours-BaseReference frames=1&(t-1), Resolution=480p, Training Data=DAVIS and YouTube-VOS2022.07 | 72.4 | — | — | 80.6 | — | — | — | 76.5 | — | |
| GIEL2022.07 | 72 | — | — | 78.3 | — | — | — | 75.2 | — | |
| GIEL2022.07 | 72 | — | — | 78.3 | — | — | — | 75.2 | — | |
| RMNet2021.03 | 71.9 | 75 | — | 78.1 | — | — | — | — | — | |
| RMNetSpatial cues=true2021.06 | 71.9 | — | — | 78.1 | — | — | — | 75 | — | |
| RMNResolution=480p, External Training Datasets=true2021.12 | 71.9 | — | — | 78.1 | — | — | — | 75 | — | |
| RMNReference frames=Multiple, Resolution=480p, Training Data=DAVIS and YouTube-VOS2022.07 | 71.9 | — | — | 78.1 | — | — | — | 75 | — | |
| RMNet2022.07 | 71.9 | — | — | 78.1 | — | — | — | 75 | — | |
| RMNet2022.07 | 71.9 | — | — | 78.1 | — | — | — | 75 | — | |
| RMNIncludes YouTube-VOS in training=true, Resolution=480p2022.08 | 71.9 | — | — | 78.1 | — | — | — | 75 | — | |
| RMNet2024.09 | 71.9 | — | — | 78.1 | — | — | — | 75 | — | |
| AOT-BReference frames=1&(t-1), Resolution=480p, Training Data=DAVIS and YouTube-VOS2022.07 | 71.8 | — | — | 79.1 | — | — | — | 75.5 | — | |
| CFBI+Includes YouTube-VOS in training=true, Resolution=480p2022.08 | 71.6 | — | — | 79.6 | — | — | — | 75.6 | — | |
| CFBI2022.07 | 71.4 | — | — | 78.7 | — | — | — | 75 | — | |
| CFBIIncludes YouTube-VOS in training=true, Resolution=480p2022.08 | 71.4 | — | — | 78.7 | — | — | — | 75 | — | |
| CFBITraining data=DAVIS + Youtube-VOS2021.04 | 71.1 | — | — | 78.5 | — | — | — | 74.8 | — | |
| CFBI2021.03 | 71.1 | 74.8 | — | 78.5 | — | — | — | — | — | |
| CFBIAdditional YouTube-VOS training=true2021.09 | 71.1 | — | — | 78.5 | — | — | — | 74.8 | — | |
| CFBIResolution=480p, External Training Datasets=false2021.12 | 71.1 | — | — | 78.5 | — | — | — | 74.8 | — | |
| CFBIReference frames=1&(t-1), Resolution=480p, Training Data=DAVIS and YouTube-VOS2022.07 | 71.1 | — | — | 78.5 | — | — | — | 74.8 | — | |
| CFBI2022.07 | 71.1 | — | — | 78.5 | — | — | — | 74.8 | — | |
| CFBI2024.09 | 71.1 | — | — | 78.5 | — | — | — | 74.8 | — | |
| STM-VOSInitialization=mask, Fine-tuning=false, Using first-frame masks=true, Time per frame (s)=0.482019.11 | 69.3 | 72.3 | — | 75.2 | — | — | — | — | — | |
| STMt/s=0.32, YouTube-VOS pretraining=true2020.07 | 69.3 | — | — | 75.2 | — | — | — | 72.2 | — | |
| STMonline-learning=false2020.07 | 69.3 | 72.2 | — | 75.2 | — | — | — | — | — | |
| STMFine-tuning=false, Post-processing=false, Ensemble=false2020.12 | 69.3 | — | — | 75.2 | — | 16.9 | — | 72.2 | — | |
| STMTraining data=DAVIS + Youtube-VOS2021.04 | 69.3 | — | — | 75.2 | — | — | — | 72.2 | — | |
| STMAdditional YouTube-VOS training=true2021.09 | 69.3 | — | — | 75.2 | — | — | — | 72.2 | — | |
| STMEvaluation resolution=600p2021.06 | 69.3 | — | — | 75.2 | — | — | — | 72.2 | — | |
| STMReference frames=Multiple, Resolution=480p, Training Data=DAVIS and YouTube-VOS2022.07 | 69.3 | — | — | 75.2 | — | — | — | 72.3 | — | |
| STM2022.07 | 69.3 | — | — | 75.2 | — | — | — | 72.2 | — | |
| STM2022.07 | 69.3 | — | — | 75.2 | — | — | — | 72.2 | — | |
| STM2024.09 | 69.3 | — | — | 75.2 | — | — | — | 72.2 | — | |
| STM2021.03 | 68 | 71 | — | 74 | — | — | — | — | — | |
| PREMVOSFine-tuning=true, Time per frame (s)=41.32019.02 | 67.5 | 71.6 | — | 75.7 | — | — | — | — | — | |
| PREMVOSInitialization=mask+ft, Fine-tuning=true, Using first-frame masks=true, Time per frame (s)=41.32019.11 | 67.5 | 71.6 | — | 75.7 | — | — | — | — | — | |
| PREMVOSOnline Training (FT)=true, Speed=0.022020.04 | 67.5 | — | — | 75.7 | — | — | — | 71.6 | — | |
| PREMVOSonline-learning=true2020.07 | 67.5 | 71.6 | — | 75.7 | — | — | — | — | — | |
| PREMVOSFine-tuning=true, Post-processing=false, Ensemble=true2020.12 | 67.5 | — | — | 75.8 | — | 21.7 | — | 71.6 | — | |
| PREMVOSTraining data=DAVIS only2021.04 | 67.5 | — | — | 75.7 | — | — | — | 71.6 | — | |
| PREMVOS2021.03 | 67.5 | 71.6 | — | 75.7 | — | — | — | — | — | |
| PREMVOSOnline Learning=true2021.09 | 67.5 | — | — | 75.7 | — | — | — | 71.6 | — | |
| PREMVOS2021.06 | 67.5 | — | — | 75.7 | — | — | — | 71.6 | — | |
| PREMVOSonline_learning=true, use_static_images=true2021.10 | 67.5 | 71.6 | — | 75.7 | — | — | — | — | 0.03 |