Vision-Language Navigation on Room-across-Room (RxR)
0.477SR (Success Rate)EnvDrop
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| EnvDropVisual Feature Extractor=CLIP2026.02 | 0.477 | 0.434 | 0.561 | 0.612 | 0.568 | 6.53 | |
| pFedNaviVisual Feature Extractor=CLIP2026.02 | 0.461 | 0.412 | 0.563 | 0.598 | 0.569 | 6.91 | |
| FedVLNVisual Feature Extractor=CLIP2026.02 | 0.43 | 0.394 | 0.515 | 0.587 | 0.548 | 7.37 | |
| EnvDropVisual Feature Extractor=ResNet-1522026.02 | 0.413 | 0.366 | 0.504 | 0.572 | 0.536 | 8.03 | |
| pFedNaviVisual Feature Extractor=ResNet-1522026.02 | 0.401 | 0.367 | 0.512 | 0.573 | 0.529 | 8.1 | |
| FedVLNVisual Feature Extractor=ResNet-1522026.02 | 0.399 | 0.331 | 0.478 | 0.555 | 0.507 | 8.62 |