Vision-Language Navigation on Room-to-Room (R2R)
61.5SREnvDrop
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| EnvDropVisual Feature Extractor=CLIP2026.02 | 61.5 | 56.5 | 69.8 | 67.3 | 55.4 | 3.94 | |
| pFedNaviVisual Feature Extractor=CLIP2026.02 | 60.7 | 57.4 | 67.3 | 68.6 | 57.1 | 3.65 | |
| FedVLNVisual Feature Extractor=CLIP2026.02 | 59.5 | 56.3 | 65.1 | 67.5 | 55.1 | 4.24 | |
| EnvDropVisual Feature Extractor=ResNet-1522026.02 | 56.7 | 54.3 | 63.9 | 67.2 | 56 | 4.55 | |
| pFedNaviVisual Feature Extractor=ResNet-1522026.02 | 54.5 | 51.7 | 65.2 | 66.4 | 54.8 | 4.86 | |
| FedVLNVisual Feature Extractor=ResNet-1522026.02 | 50.7 | 47.3 | 60.3 | 63.4 | 50.8 | 5.37 |