Point Tracking on TAP-Vid DAVIS (First)
23.5Delta Avg (<c)MAE
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| MAESetup=ZS, Size=32×32, #L.P.=-, Data=S, Evaluation Mode=queried-first mode2026.03 | 23.5 | — | — | |
| DeiTSetup=ZS, Size=32×32, #L.P.=-, Data=S, Evaluation Mode=queried-first mode2026.03 | 24 | — | — | |
| CLIPSetup=ZS, Size=32×32, #L.P.=-, Data=S, Evaluation Mode=queried-first mode2026.03 | 25.4 | — | — | |
| SAMSetup=WS, Size=32×32, #L.P.=-, Data=S, Evaluation Mode=queried-first mode2026.03 | 29.5 | — | — | |
| SimVOS-B/16Setup=WS, Size=32×32, #L.P.=-, Data=D + Y (3.4k), Evaluation Mode=queried-first mode2026.03 | 30.1 | — | — | |
| DINOv2+NNSupervision=Zero-Shot2025.10 | 31.19 | 15.19 | 61.81 | |
| SAM2-B-PlusSetup=WS, Size=32×32, #L.P.=-, Data=SA-V (50k), Evaluation Mode=queried-first mode2026.03 | 32.4 | — | — | |
| SDSetup=ZS, Size=32×32, #L.P.=-, Data=S, Evaluation Mode=queried-first mode2026.03 | 33.9 | — | — | |
| SMTCSetup=ZS, Size=30×45, #L.P.=-, Data=S, Evaluation Mode=queried-first mode2026.03 | 33.9 | — | — | |
| SAM2-LSetup=WS, Size=32×32, #L.P.=-, Data=SA-V (50k), Evaluation Mode=queried-first mode2026.03 | 34.4 | — | — | |
| DINOSetup=ZS, Size=32×32, #L.P.=-, Data=S, Evaluation Mode=queried-first mode2026.03 | 34.5 | — | — | |
| CRW (ResNet-18)Setup=ZS, Size=30×45, #L.P.=-, Data=V, Evaluation Mode=queried-first mode2026.03 | 35.9 | — | — | |
| DINOv2-S/14Setup=ZS, Size=32×32, #L.P.=-, Data=S, Evaluation Mode=queried-first mode2026.03 | 37.1 | — | — | |
| DINOv2-B/14-RegSetup=ZS, Size=32×32, #L.P.=-, Data=S, Evaluation Mode=queried-first mode2026.03 | 37.4 | — | — | |
| DINOv2-B/14Setup=ZS, Size=32×32, #L.P.=-, Data=S, Evaluation Mode=queried-first mode2026.03 | 38 | — | — | |
| DINOv3-S/16Setup=ZS, Size=32×32, #L.P.=-, Data=S, Evaluation Mode=queried-first mode2026.03 | 38 | — | — | |
| DIFT (SD1.5)Setup=ZS, Size=30×45, #L.P.=-, Data=S, Evaluation Mode=queried-first mode2026.03 | 38.2 | — | — | |
| VFS (ResNet-50)Setup=ZS, Size=30×45, #L.P.=-, Data=V, Evaluation Mode=queried-first mode2026.03 | 38.4 | — | — | |
| DINOv3-B/16Setup=ZS, Size=32×32, #L.P.=-, Data=S, Evaluation Mode=queried-first mode2026.03 | 38.9 | — | — | |
| DIFTSupervision=Zero-Shot2025.10 | 39.55 | 21.51 | 69.71 | |
| DIFT (SD2.1)Setup=ZS, Size=30×45, #L.P.=-, Data=S, Evaluation Mode=queried-first mode2026.03 | 39.7 | — | — | |
| DiffTrack (HunyuanVideo)Setup=ZS, Size=30×45, #L.P.=-, Data=V, Evaluation Mode=queried-first mode2026.03 | 44.1 | — | — | |
| DiffTrack (CogVideoX-2B)Setup=ZS, Size=30×45, #L.P.=-, Data=V, Evaluation Mode=queried-first mode2026.03 | 46.3 | — | — | |
| DiffTrack (CogVideoX-5B)Setup=ZS, Size=30×45, #L.P.=-, Data=V, Evaluation Mode=queried-first mode2026.03 | 46.9 | — | — | |
| Chrono-S/16Setup=FS, Size=32×32, #L.P.=16.2M, Data=Kubric (11k), Evaluation Mode=queried-first mode2026.03 | 48 | — | — | |
| TAP-NetSupervision=Supervised2025.10 | 48.42 | 32.05 | 77.35 | |
| TAP-NetTraining Data=Kubric2023.07 | 48.6 | 33 | 78.8 | |
| TAPNetTraining Dataset=Kub, Evaluation Resolution=256 × 2562025.07 | 48.6 | 33 | 78.8 | |
| M2Pv2-S/14-R@64Setup=WS, Size=32×32, #L.P.=4.7M, Data=D + Y (3.4k), Evaluation Mode=queried-first mode2026.03 | 48.8 | — | — | |
| SD-DINOSupervision=Zero-Shot2025.10 | 50.45 | 29.68 | 69.71 | |
| M2Pv3-S/16-R@64Setup=WS, Size=32×32, #L.P.=4.7M, Data=D + Y (3.4k), Evaluation Mode=queried-first mode2026.03 | 50.5 | — | — | |
| M2Pv2-B/14-R@64Setup=WS, Size=32×32, #L.P.=9.5M, Data=D + Y (3.4k), Evaluation Mode=queried-first mode2026.03 | 50.8 | — | — | |
| TAP-NetEvaluation Mode=First, Input Resolution=256x256, Backbone=ResNet-502024.07 | 52.9 | 36 | 80.1 | |
| M2Pv3-B/16-R@64Setup=WS, Size=32×32, #L.P.=9.5M, Data=D + Y (3.4k), Evaluation Mode=queried-first mode2026.03 | 53.5 | — | — | |
| RAFTSupervision=Supervised2025.10 | 53.55 | 34.48 | 74.9 | |
| GMRWSupervision=Self-Sup.2025.10 | 54.59 | 36.47 | 76.36 | |
| Point PromptingSupervision=Zero-Shot2025.10 | 57.29 | 42.21 | 82.9 | |
| PIPsTraining Data=FlyingThings++2023.07 | 64.8 | 12.2 | 77.7 | |
| PIPsTraining Dataset=FT [42], Evaluation Resolution=384 × 5122025.07 | 64.8 | 42.2 | 77.7 | |
| Opt-CWMSupervision=Self-Sup.2025.10 | 64.83 | 47.53 | 80.87 | |
| MFTTraining Data=Kubric+more2023.07 | 66.8 | 47.3 | 77.8 | |
| MFTEvaluation Mode=First, Input Resolution=256x256, Backbone=ResNet-502024.07 | 66.8 | 47.3 | 77.8 | |
| OmniMotionTraining Data=Not Specified2023.07 | 66.9 | 52.8 | 87.1 | |
| OmniMotionEvaluation Mode=First, Input Resolution=256x2562024.07 | 67.5 | 52.7 | 85.3 | |
| CoTrackerStride=82023.07 | 68.6 | 52.5 | 85.7 | |
| PIPs++Training Data=Point Odyssey2023.07 | 69.1 | — | — | |
| TAPIRTraining Data=Kubric2023.07 | 70 | 56.2 | 86.5 | |
| TAPIREvaluation Mode=First, Input Resolution=256x256, Backbone=ResNet-502024.07 | 70 | 56.2 | 86.5 | |
| TAPIRTraining Dataset=Kub, Evaluation Resolution=256 × 2562025.07 | 70 | 58.5 | 86.5 | |
| Online TAPIRTraining Dataset=Kub, Evaluation Resolution=256 × 2562025.07 | 70 | 56.2 | 86.5 | |
| TAPIRSupervision=Supervised2025.10 | 70.56 | 58.47 | 87.27 | |
| BootsTAP+Evaluation Mode=First, Input Resolution=256x256, Extra Training Data=15M video clips2024.07 | 74 | 61.4 | 88.4 | |
| BootsTAPIRTraining Dataset=Kub+15M, Evaluation Resolution=256 × 2562025.07 | 74 | 61.4 | 88.4 | |
| LocoTrackTraining Dataset=Kub, Evaluation Resolution=256 × 2562025.07 | 75.3 | 63 | 87.2 | |
| CoTracker-SingleEvaluation Mode=First, Input Resolution=256x2562024.07 | 75.4 | 60.6 | 89.3 | |
| CoTrackerTraining Data=Kubric2023.07 | 75.7 | 62.2 | 89.3 | |
| CoTrackerStride=42023.07 | 75.7 | 62.2 | 89.3 | |
| CoTracker2-AllEvaluation Mode=First, Input Resolution=256x2562024.07 | 75.7 | 60.7 | 88.1 | |
| CoTracker2-SingleEvaluation Mode=First, Input Resolution=256x2562024.07 | 75.7 | 62.2 | 89.3 | |
| CoTracker2Training Dataset=Kub, Evaluation Resolution=384 × 5122025.07 | 75.7 | 62.2 | 89.3 | |
| TAPTRv2Evaluation Mode=First, Input Resolution=256x256, Backbone=ResNet-502024.07 | 75.9 | 63.5 | 91.4 | |
| TAPTRv2Training Dataset=Kub, Evaluation Resolution=256 × 2562025.07 | 75.9 | 63.5 | 91.4 | |
| TAPTREvaluation Mode=First, Input Resolution=256x256, Backbone=ResNet-502024.07 | 76.1 | 63 | 91.1 | |
| TAPTRTraining Dataset=Kub, Evaluation Resolution=256 × 2562025.07 | 76.1 | 63 | 91.1 | |
| CoTracker3 (offline)Training Dataset=Kub64+15K, Evaluation Resolution=384 × 5122025.07 | 76.3 | 63.8 | 90.2 | |
| TAPNextTraining Dataset=Kub, Evaluation Resolution=256 × 2562025.07 | 76.6 | 62.4 | 90.5 | |
| TAPTRv3Training Dataset=Kub, Evaluation Resolution=256 × 2562025.07 | 76.7 | 63.2 | 91 | |
| CoTracker3 (online)Training Dataset=Kub64+15K, Evaluation Resolution=384 × 5122025.07 | 76.9 | 64.4 | 91.2 | |
| CoTracker3Supervision=Supervised2025.10 | 77.13 | 64.45 | 90.9 | |
| Anthro-LocoTrackTraining Dataset=Kub+1.4K, Evaluation Resolution=256 × 2562025.07 | 77.3 | 64.8 | 89.1 | |
| LocoTrackTraining Dataset=Kub, Evaluation Resolution=384 × 5122025.07 | 77.4 | 64.8 | 86.2 | |
| Track-OnTraining Dataset=Kub, Evaluation Resolution=384 × 5122025.07 | 78 | 65 | 90.8 | |
| BootsTAPNextTraining Dataset=Kub+15M, Evaluation Resolution=256 × 2562025.07 | 78.5 | 65.2 | 91.2 | |
| Anthro-LocoTrackTraining Dataset=Kub+1.4K, Evaluation Resolution=384 × 5122025.07 | 78.9 | 65.9 | 87.3 | |
| Anthro-TAPNextTraining Dataset=Kub+1.4K, Evaluation Resolution=256 × 2562025.07 | 79.3 | 66.1 | 91.7 | |
| TAPNextSupervision=Supervised2025.10 | 79.48 | 66.56 | 92.21 |