Coarse-grained Vision-Language Navigation on VLNVerse (test)
3.58TLGAMA
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| GAMAAction Type=unified model2025.12 | 3.58 | 4.23 | 0.372 | 0.3102 | — | — | |
| InternNav-N1year=20252025.12 | 4 | 5.71 | 17.51 | 16.54 | 23.32 | — | |
| InternVLA-N12026.06 | 4 | 5.71 | 17.51 | 16.54 | 23.32 | — | |
| Seq2SeqAction Type=discrete low-level action2025.12 | 6.32 | 5 | 0.2717 | 0.2553 | — | — | |
| NFMyear=20252025.12 | 6.52 | 4.93 | 38.02 | 23.15 | 45.93 | 24.22 | |
| NavFoM2026.06 | 6.52 | 4.93 | 38.02 | 23.15 | 45.93 | — | |
| Qwen-RobotNav-4BModel Size=4B2026.06 | 7.39 | 4.4 | 41.25 | 37.37 | 51.03 | — | |
| CMAAction Type=discrete low-level action2025.12 | 7.53 | 4.72 | 0.3185 | 0.2867 | — | — | |
| Qwen-RobotNav-8BModel Size=8B2026.06 | 7.68 | 4.08 | 46.59 | 41.54 | 55.97 | — | |
| HNRAction Type=neural implicit representation2025.12 | 7.95 | 4.62 | 0.3459 | 0.3045 | — | — | |
| RDPAction Type=continuous action2025.12 | 8.35 | 4.65 | 0.366 | 0.3221 | — | — | |
| Human2025.12 | 10.23 | 1.97 | 0.772 | 0.625 | — | — | |
| UniNavidyear=2024b2025.12 | 10.33 | 5.05 | 29.68 | 13.47 | 42.7 | 15.59 | |
| Uni-NaVid2026.06 | 10.33 | 5.05 | 29.68 | 13.47 | 42.7 | — |