Dynamic Object Segmentation on EPIC-Kitchens EPIC-Diff (test)
40.3S01 ScoreDIV-FF (full model, image infer.)
Evaluation Results
| Method | Links | |||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| DIV-FF (full model, image infer.)Mode=image inference, Descriptor=Weighted average (0.75 mask + 0.25 bbox)2025.03 | 40.3 | 30.4 | 37.4 | 29.8 | 29.5 | 32.6 | 30.6 | 15.1 | 25.1 | 33.6 | 30.5 | |
| DIV-FF (CLIP in SAM masks)Feature type=SAM mask embeddings2025.03 | 30.7 | 19.3 | 29.6 | 24.9 | 31.3 | 26.1 | 28.8 | 14.8 | 23.8 | 35.1 | 26.2 | |
| DIV-FF (CLIP in patches)Feature type=CLIP patch features, Geometry model=Dynamic (NeuralDiff)2025.03 | 26.9 | 21.7 | 18.3 | 16.8 | 18.1 | 24.9 | 17.3 | 12.3 | 17.9 | 23.6 | 19.8 | |
| LERFStatic scene assumption=true2025.03 | 22.1 | 10.1 | 11.7 | 9.7 | 13.2 | 18.6 | 12.5 | 6.2 | 19 | 5.5 | 12.8 | |
| DIV-FF (full model, video infer.)Mode=video inference, Feature field=parallel video-language2025.03 | 16.1 | 15.4 | 9.3 | 9.5 | 21.8 | 20.7 | 10.7 | 18.5 | 17.9 | 20.6 | 16.6 | |
| NeuralDiff + OWL-ViTBackbone=NeuralDiff, Detector=OWL-ViT2025.03 | 9.4 | 10.2 | 13.2 | 15.4 | 9.4 | 13.3 | 14.5 | 23.2 | 23.7 | 28.9 | 16.1 | |
| NeuralDiff + OWL-ViT + SAMBackbone=NeuralDiff, Detector=OWL-ViT, Masking=SAM2025.03 | 8.7 | 12.6 | 23.2 | 23.9 | 13.8 | 15.9 | 17.8 | 28 | 32.9 | 41.1 | 21.7 |