Vision-and-Language Navigation on REVERIE (test)
3,606SPLDUET
Evaluation Results
| Method | Links | |||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| DUET2023.12 | 3,606 | 21.3 | 5,691 | 5,251 | — | — | — | — | — | — | — | |
| AZHP2023.12 | 3,585 | 21.84 | 5,531 | 5,157 | — | — | — | — | — | — | — | |
| NaviLLMpre-training=w/ p pretrain2023.12 | 3,445 | 16.39 | 5,621 | 4,349 | — | — | — | — | — | — | — | |
| NaviLLM2023.12 | 3,233 | 15.16 | 5,175 | 3,980 | — | — | — | — | — | — | — | |
| VLN-PETL2023.12 | 2,673 | 14 | 3,606 | 3,083 | — | — | — | — | — | — | — | |
| HAMT2023.12 | 2,667 | 13.62 | 3,341 | 3,040 | — | — | — | — | — | — | — | |
| HOP2023.12 | 2,434 | 16.38 | 3,306 | 3,017 | — | — | — | — | — | — | — | |
| VLN-BERT2023.12 | 2,399 | 15.68 | 3,291 | 2,961 | — | — | — | — | — | — | — | |
| Seq2Seq2023.12 | 309 | 10.89 | 688 | 399 | — | — | — | — | — | — | — | |
| RoomTour3D-IGRTask focus=Unified, Geometry-aware training=true2026.03 | 37 | — | — | — | — | — | — | — | — | — | — | |
| BEV-BERTModel Training Strategy=Separate Model For Each Task2023.12 | 36.41 | — | — | — | — | — | — | — | — | — | — | |
| BEV-BERTTask focus=Single Task2026.03 | 36.4 | — | — | — | — | — | — | — | — | — | — | |
| DUETModel Training Strategy=Separate Model For Each Task2023.12 | 36.06 | — | — | — | — | — | — | — | — | — | — | |
| DUETTask focus=Single Task2026.03 | 36 | — | — | — | — | — | — | — | — | — | — | |
| AZHPModel Training Strategy=Separate Model For Each Task2023.12 | 35.85 | — | — | — | — | — | — | — | — | — | — | |
| AZHPTask focus=Single Task2026.03 | 35.8 | — | — | — | — | — | — | — | — | — | — | |
| NaviLLMModel Training Strategy=Unified Model For All Tasks2023.12 | 32.33 | — | — | — | — | — | — | — | — | — | — | |
| NaviLLM (w. Pretrain)Task focus=Unified2026.03 | 32.3 | — | — | — | — | — | — | — | — | — | — | |
| SF-NavLLM Backbone=GPT-4o2026.03 | 30.62 | 10.05 | 46.63 | 35.87 | 7.87 | 0.9 | 14.04 | 17.64 | 3.36 | 31.4 | 34.76 | |
| SFCo-NavLLM Backbone=GPT-4o2026.03 | 27.01 | 10.32 | 42.36 | 31.33 | 7.16 | 0.9 | 9.44 | 13.04 | 3.36 | 21.6 | 24.96 | |
| VLN-PETLModel Training Strategy=Separate Model For Each Task2023.12 | 26.73 | — | — | — | — | — | — | — | — | — | — | |
| HAMTTask focus=Single Task2026.03 | 26.7 | — | — | — | — | — | — | — | — | — | — | |
| VLN-PETLTask focus=Single Task2026.03 | 26.7 | — | — | — | — | — | — | — | — | — | — | |
| HAMTModel Training Strategy=Separate Model For Each Task2023.12 | 26.67 | — | — | — | — | — | — | — | — | — | — | |
| HOPModel Training Strategy=Separate Model For Each Task2023.12 | 24.34 | — | — | — | — | — | — | — | — | — | — | |
| HOPTask focus=Single Task2026.03 | 24.3 | — | — | — | — | — | — | — | — | — | — | |
| VLN-BERTModel Training Strategy=Separate Model For Each Task2023.12 | 23.99 | — | — | — | — | — | — | — | — | — | — | |
| NavGPTLLM Backbone=GPT-42026.03 | 14.6 | — | 28.3 | 19.2 | — | 108 | 57.35 | 489.35 | 1,440 | 49.74 | 1,489.74 | |
| MapGPTLLM Backbone=GPT-42026.03 | 14.5 | — | 42.6 | 28.4 | — | 4.95 | 7.56 | 27.36 | 66 | 26.57 | 92.57 | |
| NavCoTLLM Backbone=Tuned* Llama, Fine-tuning Status=Tuned2026.03 | 7.18 | 12.36 | 14.2 | 9.2 | — | 4.5 | 1.44 | 19.44 | 60 | 11.4 | 71.4 |