Vision-and-Language Navigation on R2R (test)
77SPL (Success weighted Path Length)SkillNav
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| SkillNav2025.08 | 77 | — | — | 84 | — | |
| Human2020.03 | 76 | 11.85 | 1.61 | 86 | — | |
| Human (Upper Bound)2025.08 | 76 | — | — | 86 | — | |
| RoomTour3D-IGRTask focus=Unified, Geometry-aware training=true2026.03 | 64 | — | — | — | — | |
| Meta-ExploreModel Training Strategy=Separate Model For Each Task2023.12 | 61 | — | — | — | — | |
| HAMTModel Training Strategy=Separate Model For Each Task2023.12 | 60 | — | — | — | — | |
| AZHPModel Training Strategy=Separate Model For Each Task2023.12 | 60 | — | — | — | — | |
| VLN-SIGModel Training Strategy=Separate Model For Each Task2023.12 | 60 | — | — | — | — | |
| BEV-BERTModel Training Strategy=Separate Model For Each Task2023.12 | 60 | — | — | — | — | |
| NaviLLMModel Training Strategy=Unified Model For All Tasks2023.12 | 60 | — | — | — | — | |
| HAMTTask focus=Single Task2026.03 | 60 | — | — | — | — | |
| VLN-SIGTask focus=Single Task2026.03 | 60 | — | — | — | — | |
| NavGPT2Task focus=Single Task2026.03 | 60 | — | — | — | — | |
| AZHPTask focus=Single Task2026.03 | 60 | — | — | — | — | |
| BEV-BERTTask focus=Single Task2026.03 | 60 | — | — | — | — | |
| NaviLLM (w. Pretrain)Task focus=Unified2026.03 | 60 | — | — | — | — | |
| HOPModel Training Strategy=Separate Model For Each Task2023.12 | 59 | — | — | — | — | |
| HOPTask focus=Single Task2026.03 | 59 | — | — | — | — | |
| DUETModel Training Strategy=Separate Model For Each Task2023.12 | 58 | — | — | — | — | |
| VLN-PETLModel Training Strategy=Separate Model For Each Task2023.12 | 58 | — | — | — | — | |
| DUETTask focus=Single Task2026.03 | 58 | — | — | — | — | |
| VLN-PETLTask focus=Single Task2026.03 | 58 | — | — | — | — | |
| VLN-BERTModel Training Strategy=Separate Model For Each Task2023.12 | 57 | — | — | — | — | |
| PREVALENT2020.03 | 51 | 10.51 | 5.3 | 54 | — | |
| PREVALENTModel Training Strategy=Separate Model For Each Task2023.12 | 51 | — | — | — | — | |
| PREVALENTTask focus=Single Task2026.03 | 51 | — | — | — | — | |
| EnvDrop2020.03 | 47 | 11.66 | 5.23 | 51 | — | |
| EnvDropTraining Paradigm=Self-Paced CL2021.11 | 45.5 | — | 5.41 | 48.4 | 53.9 | |
| ALTR2020.03 | 45 | 10.27 | 5.49 | 48 | — | |
| Press2020.03 | 45 | 10.77 | 5.49 | 49 | — | |
| EnvDropTraining Paradigm=Base2021.11 | 43.5 | — | 5.71 | 46.5 | 54.2 | |
| EnvDropTraining Paradigm=Naïve CL2021.11 | 42.5 | — | 5.9 | 44.8 | 50 | |
| The Regretful Agent2020.03 | 40 | 13.69 | 5.69 | 48 | — | |
| MT-RCM + EnvAg2020.03 | 40 | 13.35 | 6.03 | 45 | — | |
| MT-RCM+EnvModel Training Strategy=Unified Model For All Tasks2023.12 | 40 | — | — | — | — | |
| RCM2020.03 | 38 | 11.97 | 6.12 | 43 | — | |
| Self-Monitoring2020.03 | 35 | 18.04 | 5.67 | 48 | — | |
| MapGPT + AVICLLM=GPT-4o2026.02 | 31.9 | — | 5.97 | 37.5 | 45.3 | |
| Self-MonitoringTraining Paradigm=Base2021.11 | 30.9 | — | 6.29 | 40.5 | 50.2 | |
| Self-MonitoringTraining Paradigm=Self-Paced CL2021.11 | 30.8 | — | 6.29 | 39.3 | 49.9 | |
| MapGPTLLM=GPT-4o2026.02 | 30.8 | — | 6.04 | 36 | 41.6 | |
| Self-MonitoringTraining Paradigm=Naïve CL2021.11 | 30.6 | — | 6.29 | 40.8 | 53 | |
| Speaker-Follower2020.03 | 28 | 14.82 | 6.62 | 35 | — | |
| MapGPTLLM=GPT-42026.02 | 25.4 | — | 5.8 | 41.2 | 61.6 | |
| FollowerTraining Paradigm=Self-Paced CL2021.11 | 24.3 | — | 6.95 | 30.9 | 42.3 | |
| Look Before You Leap2020.03 | 23 | 9.15 | 7.53 | 25 | — | |
| FollowerTraining Paradigm=Base2021.11 | 20.7 | — | 7.05 | 29 | 41.3 | |
| FollowerTraining Paradigm=Naïve CL2021.11 | 19.6 | — | 7.16 | 28.3 | 40.9 | |
| Seq2Seq2020.03 | 18 | 8.13 | 7.85 | 20 | — | |
| NavGPTLLM=GPT-3.52026.02 | 13 | — | 8.02 | 16.7 | 26.4 | |
| Random2020.03 | 12 | 9.93 | 9.77 | 13 | — |