UAV Vision-and-Language Navigation on AirNav seen (val)
39.6Navigation Error (NE)AirVLN-R1
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| AirVLN-R1Training Paradigm=SFT+RFT, Backbone=Qwen2.5-VL-7B2026.01 | 39.6 | 5,179 | 61.45 | 5,063 | |
| Qwen2.5-VL-7BTraining Paradigm=SFT-only, Model Scale=7B2026.01 | 45.8 | 4,389 | 54.56 | 4,266 | |
| GPT-5Training Paradigm=Zero-shot2026.01 | 151.2 | 287 | 3.19 | 259 | |
| GPT-4oTraining Paradigm=Zero-shot2026.01 | 155.4 | 453 | 8.53 | 407 | |
| Qwen3-VL-235B-A22BTraining Paradigm=Zero-shot, Model Scale=235B2026.01 | 157.6 | 550 | 9.12 | 512 | |
| Qwen2.5-VL-32BTraining Paradigm=Zero-shot, Model Scale=32B2026.01 | 161.6 | 302 | 3.36 | 273 | |
| Qwen2.5-VL-7BTraining Paradigm=RFT-only, Model Scale=7B2026.01 | 165.7 | 233 | 4.75 | 210 | |
| LLaMA-3.2-11B-VisionTraining Paradigm=Zero-shot, Model Scale=11B2026.01 | 180.5 | 110 | 5.29 | 93 | |
| Qwen2.5-VL-7BTraining Paradigm=Zero-shot, Model Scale=7B2026.01 | 183.1 | 182 | 2.18 | 168 | |
| CMATraining Paradigm=Cross-Modal Attention2026.01 | 185.9 | 513 | 15.96 | 473 | |
| RandomTraining Paradigm=Random Baseline2026.01 | 222.3 | 79 | 5.59 | 71 | |
| Seq2SeqTraining Paradigm=Imitation Learning2026.01 | 321.5 | 158 | 9.5 | 140 |