Semantic Correspondence on SPair-71k (PCK 0.01, 0.05, 0.10)
27PCK @ 0.01MARCO
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| MARCOSupervision=Supervised, DINOv2 Encoder=true, SD Encoder=false, Uses object masks at training=true2026.04 | 27 | 77.6 | 87.2 | |
| MARCOSupervision=Supervised, DINOv2 Encoder=true, SD Encoder=false2026.04 | 26.6 | 75.5 | 86.7 | |
| Ours (AP-10K P.T.)Supervision=Supervised, AP-10K Pre-training=true2023.11 | 22 | 75.3 | 85.6 | |
| Ours (Adapt. Pose)†Supervision=Supervised, Adaptive Pose Alignment=true, Index Flipping=true2023.11 | 21.7 | 72.8 | 83.2 | |
| Geo-SCSupervision=Supervised, DINOv2 Encoder=true, SD Encoder=true, Uses object masks at inference=true2026.04 | 21.7 | 72.8 | 83.2 | |
| OursSupervision=Supervised2023.11 | 21.6 | 72.6 | 82.9 | |
| Jamais VuSupervision=Supervised, DINOv2 Encoder=true, SD Encoder=true, Uses depth maps at training=true, Uses object masks at training=true2026.04 | 20.5 | 71.9 | 82.5 | |
| GECOSupervision=Supervised, DINOv2 Encoder=false, SD Encoder=true, Uses object masks at training=true2026.04 | 14.2 | 59.6 | 73.6 | |
| DIY-SCSupervision=Unsupervised / Weakly Supervised, DINOv2 Encoder=true, SD Encoder=true, Uses object masks at training=true2026.04 | 10.1 | 53.8 | 71.6 | |
| Ours-Zero-Shot+Supervision=Zero-shot2023.11 | 9.9 | 49.1 | 65.4 | |
| SD+DINO (S)Supervision=Supervised2023.11 | 9.6 | 57.7 | 74.6 | |
| SD+DINOv2Supervision=Supervised, DINOv2 Encoder=true, SD Encoder=true2026.04 | 9.6 | 57.7 | 74.6 | |
| SD+DINO (S)Supervision=Supervised2026.07 | 9.6 | 57.7 | 74.6 | |
| DHFSupervision=Supervised2023.11 | 8.7 | 50.2 | 64.9 | |
| DHFSupervision=Supervised, DINOv2 Encoder=false, SD Encoder=true2026.04 | 8.7 | 50.2 | 64.9 | |
| DHFSupervision=Supervised2026.07 | 8.7 | 50.2 | 64.9 | |
| MREPSupervision=Unsupervised2026.07 | 8.6 | 50.1 | 64.7 | |
| DiTFSupervision=Unsupervised2026.07 | 8.3 | 49.3 | 64 | |
| ViT-UpBackbone=DINOv3-B2026.06 | 7.93 | 42 | 58.1 | |
| SD+DINOSupervision=Zero-shot2023.11 | 7.9 | 44.7 | 59.9 | |
| SD+DINOv2Supervision=Unsupervised / Weakly Supervised, DINOv2 Encoder=true, SD Encoder=true2026.04 | 7.9 | 44.7 | 59.9 | |
| ViT-UpBackbone=DINOv3-S+, Input Resolution=448x448, Output Resolution=448x4482026.06 | 7.3 | 39.07 | 55.44 | |
| DIFTSupervision=Zero-shot2023.11 | 7.2 | 39.7 | 52.9 | |
| DIFTSupervision=Unsupervised / Weakly Supervised, DINOv2 Encoder=false, SD Encoder=true2026.04 | 7.2 | 39.7 | 52.9 | |
| DIFTSupervision=Unsupervised2026.07 | 7.2 | 39.7 | 52.9 | |
| DINOv2+NNSupervision=Zero-shot2023.11 | 6.3 | 38.4 | 53.9 | |
| DINOv2+NNSupervision=Unsupervised / Weakly Supervised, DINOv2 Encoder=true, SD Encoder=false2026.04 | 6.3 | 38.4 | 53.9 | |
| DINOv2+NNSupervision=Unsupervised2026.07 | 6.3 | 38.4 | 53.9 | |
| CATS++*Supervision=Supervised, Fine-tuned backbone=true2023.11 | 4.3 | 40.7 | 59.8 | |
| CATs++Supervision=Supervised2026.07 | 4.3 | 40.7 | 59.8 | |
| BilinearBackbone=DINOv3-B2026.06 | 3.89 | 34.03 | 50.01 | |
| BilinearBackbone=DINOv3-S+, Input Resolution=448x448, Output Resolution=448x4482026.06 | 3.83 | 33.74 | 51.27 | |
| SCorrSAN*Supervision=Supervised, Fine-tuned backbone=true2023.11 | 3.6 | 36.3 | 55.3 | |
| SCorrSANSupervision=Supervised2026.07 | 3.6 | 36.3 | 55.3 | |
| w/o MREPSupervision=Unsupervised2026.07 | 3.5 | 21.4 | 29.9 | |
| UpLiFTBackbone=DINOv3-S+, Input Resolution=448x448, Output Resolution=448x4482026.06 | 3.43 | 29.15 | 46.87 | |
| NAFBackbone=DINOv3-B2026.06 | 3.41 | 29.09 | 47.19 | |
| NAFBackbone=DINOv3-S+, Input Resolution=448x448, Output Resolution=448x4482026.06 | 2.89 | 33.96 | 48.68 | |
| AnyUpBackbone=DINOv3-S+, Input Resolution=448x448, Output Resolution=448x4482026.06 | 1.97 | 19.31 | 37.63 | |
| JAFARBackbone=DINOv3-S+, Input Resolution=448x448, Output Resolution=448x4482026.06 | 1.89 | 18.59 | 36.82 |