Aerial Vision-and-Language Navigation on ANDH Seen 1.0 (val)
14.7SPLHAA-Transformer
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| HAA-Transformerhuman attention prediction training=true2022.05 | 14.7 | 17.3 | 56.3 | |
| E.T.Input Modality=Vision and Language2022.05 | 12.1 | 14.1 | 50.1 | |
| HAA-LSTMhuman attention prediction training=true2022.05 | 11.6 | 13 | 50.3 | |
| E.T.Input Modality=Language-only2022.05 | 9.2 | 11.6 | 48.9 | |
| LSTM2022.05 | 9 | 10.3 | 31.9 | |
| HAA-LSTMhuman attention prediction training=true2022.05 | 3.8 | 4.1 | 52.2 | |
| HAA-Transformerhuman attention prediction training=true2022.05 | 3.7 | 5.1 | 54.6 | |
| E.T.Input Modality=Vision-only2022.05 | 3.1 | 3.8 | 0.2 | |
| E.T.Input Modality=Vision and Language2022.05 | 2.2 | 3.1 | 51.3 | |
| E.T.Input Modality=Language-only2022.05 | 1.9 | 1.9 | 54.8 | |
| E.T.Input Modality=Vision-only2022.05 | 1.4 | 2 | -1.1 | |
| LSTM2022.05 | 1 | 1 | 43.8 | |
| Random2022.05 | 0.5 | 1.6 | -84.1 | |
| Random2022.05 | 0 | 0 | -176.6 |