Visual Place Recognition on Pitts250k
96.9Recall@1FoL++
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| FoL++Architecture=ViT-L, Evaluation Protocol=Two-Stage, Training Resolution=224x224, Inference Resolution=322x3222026.04 | 96.9 | 99 | 99.4 | |
| FoLArchitecture=ViT-L, Evaluation Protocol=Two-Stage, Version=AAAI'25, Training Resolution=224x224, Inference Resolution=322x3222026.04 | 96.8 | 99 | 99.4 | |
| BoQBackbones=DINOv2-B, Cd=122882025.07 | 96.6 | — | — | |
| QAABackbones=DINOv2-B, Cd=81922025.07 | 96.6 | — | — | |
| BoQQuery Network=DINOv2-B, Gallery Model Training Configuration=BoQ (DINOv2-B), Retrieval Protocol=Symmetric2025.12 | 96.6 | 99.1 | — | |
| BoQArchitecture=ViT-B, Evaluation Protocol=Single-Stage, Training Resolution=224x224, Inference Resolution=322x3222026.04 | 96.6 | 99.1 | 99.5 | |
| SelaVPR++Architecture=ViT-L, Evaluation Protocol=Two-Stage, Version=TPAMI'25, Training Resolution=224x224, Inference Resolution=322x3222026.04 | 96.6 | 99 | 99.3 | |
| ImAgeArchitecture=ViT-B, Evaluation Protocol=Single-Stage, Training Resolution=224x224, Inference Resolution=322x3222026.04 | 96.5 | 99.1 | 99.5 | |
| QAABackbones=DINOv2-B, Cd=20482025.07 | 96.4 | — | — | |
| QAABackbones=DINOv2-B, Cd=40962025.07 | 96.3 | — | — | |
| QAABackbones=DINOv2-B, Cd=10242025.07 | 96.3 | — | — | |
| FoLArchitecture=ViT-B, Evaluation Protocol=Two-Stage, Version=AAAI'25, Training Resolution=224x224, Inference Resolution=322x3222026.04 | 96.1 | 99.1 | 99.5 | |
| EDTFormerArchitecture=ViT-B, Evaluation Protocol=Single-Stage, Training Resolution=224x224, Inference Resolution=322x3222026.04 | 95.9 | 98.8 | 99.3 | |
| SelaVPR++Architecture=ViT-B, Evaluation Protocol=Two-Stage, Version=TPAMI'25, Training Resolution=224x224, Inference Resolution=322x3222026.04 | 95.9 | 98.6 | 99.2 | |
| SAGEArchitecture=ViT-B, Evaluation Protocol=Single-Stage, Training Resolution=224x224, Inference Resolution=322x3222026.04 | 95.7 | 98.6 | 99.2 | |
| FoL++Architecture=ViT-B, Evaluation Protocol=Two-Stage, Training Resolution=224x224, Inference Resolution=322x3222026.04 | 95.7 | 98.6 | 99.2 | |
| SelaVPRArchitecture=ViT-L, Evaluation Protocol=Two-Stage, Version=ICLR'24, Training Resolution=224x224, Inference Resolution=322x3222026.04 | 95.7 | 98.8 | 99.2 | |
| CricaVPRArchitecture=ViT-B, Evaluation Protocol=Single-Stage, Training Resolution=224x224, Inference Resolution=322x3222026.04 | 95.6 | 98.9 | 99.5 | |
| FoL++Architecture=ViT-L, Evaluation Protocol=global, Training Resolution=224x224, Inference Resolution=322x3222026.04 | 95.6 | 98.8 | 99.2 | |
| AsymVPRQuery Network=EfficientViT-B2, Gallery Model Training Configuration=BoQ (DINOv2-B), Retrieval Protocol=Asymmetric2025.12 | 95.4 | 98.5 | — | |
| SALAD CMBackbones=DINOv2-B, Cd=84482025.07 | 95.2 | — | — | |
| SALAD-CMArchitecture=ViT-B, Evaluation Protocol=Single-Stage, Training Resolution=224x224, Inference Resolution=322x3222026.04 | 95.2 | 98.8 | 99.3 | |
| SALADQuery Network=DINOv2-B, Gallery Model Training Configuration=SALAD (DINOv2-B), Retrieval Protocol=Symmetric2025.12 | 95.1 | 98.6 | — | |
| SALADArchitecture=ViT-B, Evaluation Protocol=Single-Stage, Training Resolution=224x224, Inference Resolution=322x3222026.04 | 95.1 | 98.5 | 99.1 | |
| D3stillQuery Network=EfficientViT-B2, Gallery Model Training Configuration=BoQ (DINOv2-B), Retrieval Protocol=Asymmetric2025.12 | 95 | 98.4 | — | |
| CSDQuery Network=EfficientViT-B2, Gallery Model Training Configuration=BoQ (DINOv2-B), Retrieval Protocol=Asymmetric2025.12 | 94.6 | 98.4 | — | |
| FoL++Architecture=ViT-B, Evaluation Protocol=global, Training Resolution=224x224, Inference Resolution=322x3222026.04 | 94.6 | 98.3 | 99 | |
| EfficientViT-B2-BoQQuery Network=EfficientViT-B2, Gallery Model Training Configuration=BoQ (DINOv2-B), Retrieval Protocol=Symmetric2025.12 | 94.3 | 98.3 | — | |
| MSPQuery Network=EfficientViT-B2, Gallery Model Training Configuration=BoQ (DINOv2-B), Retrieval Protocol=Asymmetric2025.12 | 94.3 | 98.1 | — | |
| MixVPRBackbones=ResNet-50, Cd=40962025.07 | 94.2 | — | — | |
| EigenPlaceBackbones=ResNet-50, Cd=20482025.07 | 94.1 | — | — | |
| EigenPlacesBackbone=ResNet-50, Descriptor Dimension=20482023.08 | 94.1 | — | — | |
| MixVPRBackbone=ResNet-50, Descriptor Dimension=40962023.08 | 94.1 | — | — | |
| EigenPlacesBackbone=ResNet-50, Descriptor Dimension=5122023.08 | 93.5 | — | — | |
| AsymVPRQuery Network=MobileViTv2, Gallery Model Training Configuration=BoQ (DINOv2-B), Retrieval Protocol=Asymmetric2025.12 | 93.4 | 97.8 | — | |
| D3stillQuery Network=MobileViTv2, Gallery Model Training Configuration=BoQ (DINOv2-B), Retrieval Protocol=Asymmetric2025.12 | 93.2 | 97.5 | — | |
| MixVPRBackbone=ResNet-50, Descriptor Dimension=5122023.08 | 93 | — | — | |
| MixVPRDescriptor dimension=512, Train set=GSV-Cities2024.06 | 93 | — | — | |
| MSPQuery Network=MobileViTv2, Gallery Model Training Configuration=BoQ (DINOv2-B), Retrieval Protocol=Asymmetric2025.12 | 93 | 97.6 | — | |
| MobileViTv2-BoQQuery Network=MobileViTv2, Gallery Model Training Configuration=BoQ (DINOv2-B), Retrieval Protocol=Symmetric2025.12 | 92.8 | 98 | — | |
| Conv-APBackbone=ResNet-50, Descriptor Dimension=81922023.08 | 92.6 | — | — | |
| CSDQuery Network=MobileViTv2, Gallery Model Training Configuration=BoQ (DINOv2-B), Retrieval Protocol=Asymmetric2025.12 | 92.5 | 97.5 | — | |
| Conv-APBackbones=ResNet-50, Cd=40962025.07 | 92.4 | — | — | |
| AsymVPRQuery Network=EfficientViT-B2, Gallery Model Training Configuration=SALAD (DINOv2-B), Retrieval Protocol=Asymmetric2025.12 | 92.4 | 97.5 | — | |
| CosPlaceBackbones=ResNet-50, Cd=20482025.07 | 92.3 | — | — | |
| CosPlaceBackbone=ResNet-50, Descriptor Dimension=20482023.08 | 92.3 | — | — | |
| Conv-APBackbone=ResNet-50, Descriptor Dimension=20482023.08 | 92.3 | — | — | |
| Conv-APBackbone=ResNet-50, Descriptor Dimension=40962023.08 | 92.3 | — | — | |
| ProGeo (CNN)Descriptor dimension=512, Train set=SF-XL2024.06 | 92.2 | 97.7 | — | |
| EfficientViT-B2-SALADQuery Network=EfficientViT-B2, Gallery Model Training Configuration=SALAD (DINOv2-B), Retrieval Protocol=Symmetric2025.12 | 92.1 | 97.1 | — | |
| D3stillQuery Network=EfficientViT-B2, Gallery Model Training Configuration=SALAD (DINOv2-B), Retrieval Protocol=Asymmetric2025.12 | 91.9 | 97 | — | |
| CosPlaceBackbone=ResNet-50, Descriptor Dimension=5122023.08 | 91.7 | — | — | |
| MSPQuery Network=EfficientViT-B2, Gallery Model Training Configuration=SALAD (DINOv2-B), Retrieval Protocol=Asymmetric2025.12 | 91.6 | 96.7 | — | |
| ROPQuery Network=EfficientViT-B2, Gallery Model Training Configuration=BoQ (DINOv2-B), Retrieval Protocol=Asymmetric2025.12 | 91.6 | 97.1 | — | |
| EigenPlacesBackbone=VGG-16, Descriptor Dimension=5122023.08 | 91.2 | — | — | |
| CSDQuery Network=EfficientViT-B2, Gallery Model Training Configuration=SALAD (DINOv2-B), Retrieval Protocol=Asymmetric2025.12 | 91.2 | 97 | — | |
| ProGeo (Transformer)Descriptor dimension=512, Train set=SF-XL2024.06 | 90.7 | 95.9 | — | |
| ROPQuery Network=MobileViTv2, Gallery Model Training Configuration=BoQ (DINOv2-B), Retrieval Protocol=Asymmetric2025.12 | 90.7 | 96.8 | — | |
| SRFSBackbones=VGG-16, Cd=40962025.07 | 90.4 | — | — | |
| SFRSBackbone=VGG-16, Descriptor Dimension=40962023.08 | 90.4 | — | — | |
| Conv-APBackbone=ResNet-50, Descriptor Dimension=5122023.08 | 90.4 | — | — | |
| Conv-APDescriptor dimension=512, Train set=GSV-Cities2024.06 | 90.4 | — | — | |
| EigenPlacesBackbone=ResNet-50, Descriptor Dimension=1282023.08 | 90.2 | — | — | |
| SFRSDesc. dim.=4096, Train set=Pitts30k, Backbone=VGG-162022.04 | 90.1 | 95.8 | — | |
| SFRSDescriptor dimension=4096, Train set=Pitts30k2024.06 | 90.1 | 95.8 | — | |
| CosPlaceDesc. dim.=512, Train set=SF-XL, Backbone=VGG-162022.04 | 89.7 | 96.4 | — | |
| CosPlaceBackbone=VGG-16, Descriptor Dimension=5122023.08 | 89.7 | — | — | |
| CosPlaceDescriptor dimension=512, Train set=SF-XL2024.06 | 89.7 | 96.4 | — | |
| CosPlaceBackbone=ResNet-50, Descriptor Dimension=1282023.08 | 89.6 | — | — | |
| ROPQuery Network=EfficientViT-B2, Gallery Model Training Configuration=SALAD (DINOv2-B), Retrieval Protocol=Asymmetric2025.12 | 89.1 | 96.1 | — | |
| AsymVPRQuery Network=MobileViTv2, Gallery Model Training Configuration=SALAD (DINOv2-B), Retrieval Protocol=Asymmetric2025.12 | 89 | 95.2 | — | |
| APPSVRDesc. dim.=4096, Train set=Pitts30k, Backbone=VGG-162022.04 | 88.8 | 94.8 | — | |
| APPSVRDescriptor dimension=4096, Train set=Pitts30k2024.06 | 88.8 | 95.6 | — | |
| MixVPRBackbone=ResNet-50, Descriptor Dimension=1282023.08 | 88.7 | — | — | |
| MSPQuery Network=MobileViTv2, Gallery Model Training Configuration=SALAD (DINOv2-B), Retrieval Protocol=Asymmetric2025.12 | 88.4 | 95.6 | — | |
| CSDQuery Network=MobileViTv2, Gallery Model Training Configuration=SALAD (DINOv2-B), Retrieval Protocol=Asymmetric2025.12 | 88.1 | 95.5 | — | |
| SAREDesc. dim.=4096, Train set=Pitts30k, Backbone=VGG-162022.04 | 88 | 94.8 | — | |
| SAREDescriptor dimension=4096, Train set=Pitts30k2024.06 | 88 | 94.8 | — | |
| MobileViTv2-SALADQuery Network=MobileViTv2, Gallery Model Training Configuration=SALAD (DINOv2-B), Retrieval Protocol=Symmetric2025.12 | 87.9 | 95.1 | — | |
| SRALNetDesc. dim.=4096, Train set=Pitts30k, Backbone=VGG-162022.04 | 87.8 | — | — | |
| SRALNetDescriptor dimension=4096, Train set=Pitts30k2024.06 | 87.8 | 94.8 | — | |
| CleanBackbone=ResNet18, Descriptor Bit Length=642026.06 | 87.5 | — | — | |
| CRNDesc. dim.=32768, Train set=Pitts30k, Backbone=VGG-162022.04 | 87 | 94.5 | — | |
| CRNDescriptor dimension=32768, Train set=Pitts30k2024.06 | 87 | 94.5 | — | |
| ROPQuery Network=MobileViTv2, Gallery Model Training Configuration=SALAD (DINOv2-B), Retrieval Protocol=Asymmetric2025.12 | 86.5 | 94.5 | — | |
| D3stillQuery Network=MobileViTv2, Gallery Model Training Configuration=SALAD (DINOv2-B), Retrieval Protocol=Asymmetric2025.12 | 86.5 | 94 | — | |
| NetVLADBackbones=VGG-16, Cd=40962025.07 | 85.9 | — | — | |
| NetVLADDesc. dim.=32768, Train set=Pitts30k, Backbone=VGG-162022.04 | 85.9 | 93.6 | — | |
| NetVLADBackbone=VGG-16, Descriptor Dimension=40962023.08 | 85.9 | — | — | |
| NetVLADDescriptor dimension=32768, Train set=Pitts30k2024.06 | 85.9 | 93.6 | — | |
| CleanBackbone=ResNet18, Descriptor Bit Length=322026.06 | 85.2 | — | — | |
| CleanBackbone=VGG16, Descriptor Bit Length=642026.06 | 84.9 | — | — | |
| APANetDesc. dim.=512, Train set=Pitts30k, Backbone=VGG-162022.04 | 83.7 | 92.6 | — | |
| APANetDescriptor dimension=512, Train set=Pitts30k2024.06 | 83.7 | 92.6 | — | |
| CleanBackbone=VGG16, Descriptor Bit Length=322026.06 | 82.3 | — | — | |
| CleanBackbone=ResNet18, Descriptor Bit Length=162026.06 | 81.7 | — | — | |
| NetVLADDesc. dim.=32768, Train set=SF-XL*, Backbone=VGG-162022.04 | 81.5 | 90.8 | — | |
| NetVLADDesc. dim.=32768, Train set=MSLS, Backbone=VGG-162022.04 | 79.7 | 90.2 | — | |
| NetVLADDescriptor dimension=32768, Train set=MSLS2024.06 | 79.7 | 90.2 | — | |
| CleanBackbone=VGG16, Descriptor Bit Length=162026.06 | 78.5 | — | — |