Vision-Language Navigation on R2R 1 (val seen)
1.67Navigation Error (NE)BEVBert
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| BEVBertBackbone=Cross-Modal Transformer2026.03 | 1.67 | 13.56 | 88 | 81 | 74 | |
| ScaleVLNBackbone=Cross-Modal Transformer2026.03 | 2.12 | 13.24 | 87 | 81 | 75 | |
| DUETBackbone=Cross-Modal Transformer2026.03 | 2.28 | 12.32 | 86 | 79 | 73 | |
| HAMTBackbone=Cross-Modal Transformer2026.03 | 2.52 | 11.15 | — | 76 | 72 | |
| Speaker FollowerBackbone=LSTM2026.03 | 3.36 | — | 74 | 66 | — | |
| TagaVLMBackbone=Qwen2 (7B)2026.03 | 4.71 | 10.16 | 64.15 | 55.53 | 53.05 | |
| TagaVLMBackbone=Qwen2 (0.5B)2026.03 | 5.23 | 10.08 | 60.03 | 53.48 | 50.4 | |
| Seq2SeqBackbone=LSTM2026.03 | 6.01 | 11.33 | 53 | 39 | — | |
| NavCoTBackbone=LLaMA2 (7B)2026.03 | 6.46 | 10.08 | 48.38 | 41.33 | 38.43 | |
| LangNavBackbone=LLaMA2 (7B)2026.03 | 7.4 | — | 40 | 32 | 28 |