UAV Vision-and-Language Navigation on AirNav Unseen (test)
40Normalized Error (NE)AirVLN-R1
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| AirVLN-R1Training Paradigm=SFT+RFT, Backbone=Qwen2.5-VL-7B2026.01 | 40 | 5,175 | 62.29 | 5,057 | |
| Qwen2.5-VL-7BTraining Paradigm=SFT-only, Model Scale=7B2026.01 | 48.3 | 3,956 | 52.41 | 3,852 | |
| GPT-5Training Paradigm=Zero-shot2026.01 | 154.4 | 262 | 2.79 | 234 | |
| Qwen3-VL-235B-A22BTraining Paradigm=Zero-shot, Model Scale=235B2026.01 | 157.1 | 494 | 7.98 | 448 | |
| GPT-4oTraining Paradigm=Zero-shot2026.01 | 157.9 | 429 | 7.48 | 388 | |
| Qwen2.5-VL-32BTraining Paradigm=Zero-shot, Model Scale=32B2026.01 | 164.4 | 284 | 3.09 | 252 | |
| Qwen2.5-VL-7BTraining Paradigm=RFT-only, Model Scale=7B2026.01 | 165.8 | 231 | 4.39 | 203 | |
| LLaMA-3.2-11B-VisionTraining Paradigm=Zero-shot, Model Scale=11B2026.01 | 178.6 | 131 | 1.44 | 103 | |
| Qwen2.5-VL-7BTraining Paradigm=Zero-shot, Model Scale=7B2026.01 | 186.2 | 165 | 1.88 | 146 | |
| CMATraining Paradigm=Cross-Modal Attention2026.01 | 190.3 | 448 | 17.06 | 403 | |
| RandomTraining Paradigm=Random Baseline2026.01 | 218.9 | 77 | 5.31 | 67 | |
| Seq2SeqTraining Paradigm=Imitation Learning2026.01 | 336.1 | 128 | 10.31 | 108 |