Vision-and-Language Navigation on GSA-R2R R-Basic (test)
79Success RateSkillNav (ScaleVLN-Aug)
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| SkillNav (ScaleVLN-Aug)large-scale data augmentation=true, visual encoder=CLIP-B/16, language backbone=BERT-base-uncased, action router=GPT-4o2025.08 | 79 | — | — | 69 | — | |
| ScaleVLNlarge-scale data augmentation=true2025.08 | 78 | — | — | 67 | — | |
| SRDFlarge-scale data augmentation=true2025.08 | 71 | — | — | 63 | — | |
| SkillNav (SRDF-Aug)large-scale data augmentation=true, visual encoder=InternViT-6B, action router=GPT-4o2025.08 | 71 | — | — | 64 | — | |
| slow4fast-VLNAdaptation Method Group=Memory-Based Methods2026.01 | 70.8 | 9.6 | 2.9 | 65 | 72.1 | |
| GR-DUETAdaptation Method Group=Memory-Based Methods2026.01 | 69.3 | 9.4 | 3.1 | 64.3 | 71.4 | |
| GR-DUET2025.08 | 69 | — | — | 64 | — | |
| DUET + BTAdaptation Method Group=Optimization-Based Methods2026.01 | 61.3 | 8 | 3.8 | 57.7 | 70.1 | |
| NavGPT-2 (FlanT5-5B)Backbone=FlanT5-5B2025.08 | 58 | — | — | 45 | — | |
| DUET2025.08 | 58 | — | — | 47 | — | |
| BEVBERT2025.08 | 58 | — | — | 45 | — | |
| DUET + MLMAdaptation Method Group=Optimization-Based Methods2026.01 | 57.9 | 13.1 | 4.1 | 47.3 | 55.9 | |
| DUETAdaptation Method Group=Baseline2026.01 | 57.7 | 13.1 | 4.2 | 47 | 55.6 | |
| DUET + MRCAdaptation Method Group=Optimization-Based Methods2026.01 | 57.7 | 13.1 | 4.2 | 47 | 55.6 | |
| DUET + SARAdaptation Method Group=Optimization-Based Methods2026.01 | 57.6 | 13.8 | 4 | 44.6 | 53 | |
| DUET + TENTAdaptation Method Group=Optimization-Based Methods2026.01 | 57.2 | 14.6 | 4.2 | 44.2 | 52.9 | |
| HAMT2025.08 | 48 | — | — | 44 | — | |
| NavCoT (LLaMA2)Backbone=LLaMA22025.08 | 37 | — | — | 35 | — | |
| MapGPT (GPT4v)Backbone=GPT4v2025.08 | 34 | — | — | 30 | — | |
| OVER-NAVAdaptation Method Group=Memory-Based Methods2026.01 | 22.3 | 14.1 | 6.7 | 16.8 | 37.1 | |
| TourHAMTAdaptation Method Group=Memory-Based Methods2026.01 | 14.9 | 11.6 | 7.4 | 12.2 | 34.7 |