UAV Vision-and-Language Navigation on AirNav Unseen (val)
41NEAirVLN-R1
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| AirVLN-R1Training Paradigm=SFT+RFT, Backbone=Qwen2.5-VL-7B2026.01 | 41 | 5,166 | 61.68 | 5,045 | |
| Qwen2.5-VL-7BTraining Paradigm=SFT-only, Model Scale=7B2026.01 | 49.2 | 4,068 | 52.03 | 3,961 | |
| GPT-5Training Paradigm=Zero-shot2026.01 | 157 | 252 | 2.62 | 220 | |
| GPT-4oTraining Paradigm=Zero-shot2026.01 | 165.8 | 413 | 7.06 | 371 | |
| Qwen3-VL-235B-A22BTraining Paradigm=Zero-shot, Model Scale=235B2026.01 | 169.1 | 518 | 8.32 | 466 | |
| Qwen2.5-VL-32BTraining Paradigm=Zero-shot, Model Scale=32B2026.01 | 172.1 | 264 | 2.94 | 236 | |
| Qwen2.5-VL-7BTraining Paradigm=RFT-only, Model Scale=7B2026.01 | 175 | 207 | 3.86 | 182 | |
| Qwen2.5-VL-7BTraining Paradigm=Zero-shot, Model Scale=7B2026.01 | 194.1 | 157 | 1.74 | 138 | |
| LLaMA-3.2-11B-VisionTraining Paradigm=Zero-shot, Model Scale=11B2026.01 | 194.3 | 137 | 4.45 | 123 | |
| CMATraining Paradigm=Cross-Modal Attention2026.01 | 203.6 | 403 | 15.71 | 362 | |
| RandomTraining Paradigm=Random Baseline2026.01 | 225 | 72 | 4.57 | 64 | |
| Seq2SeqTraining Paradigm=Imitation Learning2026.01 | 348.8 | 92 | 9.35 | 72 |