Fine-grained Vision-Language Navigation on VLNVerse (test)
5.53TLGAMA
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| GAMAAction Type=unified model2025.12 | 5.53 | 4.52 | 0.3772 | 0.3385 | — | — | |
| Seq2SeqAction Type=discrete low-level action2025.12 | 5.63 | 4.79 | 0.3019 | 0.2815 | — | — | |
| HNRAction Type=neural implicit representation2025.12 | 7.98 | 4.93 | 0.3224 | 0.2903 | — | — | |
| Qwen-RobotNav-4BModel Size=4B2026.06 | 7.99 | 3.05 | 0.6261 | 0.5622 | 0.7036 | — | |
| Qwen-RobotNav-8BModel Size=8B2026.06 | 8.16 | 3 | 0.6375 | 0.5793 | 0.7281 | — | |
| RDPAction Type=continuous action2025.12 | 8.18 | 4.6 | 0.3638 | 0.3229 | — | — | |
| CMAAction Type=discrete low-level action2025.12 | 8.53 | 5.24 | 0.2883 | 0.2554 | — | — | |
| NFMyear=20252025.12 | 8.58 | 4.13 | 0.5159 | 0.324 | 0.6968 | 19.35 | |
| NavFoM2026.06 | 8.58 | 4.13 | 0.5159 | 0.324 | 0.6968 | — | |
| InternNav-N1year=20252025.12 | 9.23 | 5.68 | 0.2895 | 0.25 | 0.3869 | — | |
| InternVLA-N12026.06 | 9.23 | 5.68 | 0.2895 | 0.25 | 0.3869 | — | |
| Human2025.12 | 12.13 | 1.74 | 0.86 | 0.686 | — | — | |
| UniNavidyear=2024b2025.12 | 12.35 | 4.11 | 0.4574 | 0.2691 | 0.6702 | 12.04 | |
| Uni-NaVid2026.06 | 12.35 | 4.11 | 0.4574 | 0.2691 | 0.6702 | — |