Audio Captioning on DCASE Task 6 2020 (dev test)
53.7BLEU-1Ensemble
Evaluation Results
| Method | Links | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| EnsembleEnsemble Size=20 models, Configuration=Simplified Submission 12020.07 | 53.7 | 34.8 | 23.5 | 15.6 | 31.9 | 15.2 | 35.9 | 9.4 | 20.7 | |
| Model4Modification=Removed Mix-up augmentation for text2020.07 | 53 | 33.7 | 22.4 | 14.5 | 30.2 | 14.8 | 35.2 | 9.1 | 19.6 | |
| Model1Architecture=Base model2020.07 | 52.6 | 33.5 | 22.4 | 14.6 | 30.1 | 14.7 | 34.7 | 9 | 19.5 | |
| Model3Modification=Removed meta keyword estimation block and attention block2020.07 | 51.7 | 33 | 22 | 14.5 | 30 | 14.7 | 34.3 | 8.6 | 19.3 | |
| Model2Modification=FC layer instead of MHSA layer in caption keyword estimation block2020.07 | 51.2 | 32.1 | 21.3 | 14.1 | 29.7 | 14.5 | 33.9 | 9.1 | 19.4 | |
| Baseline2020.07 | 38.9 | 13.6 | 5.5 | 1.5 | 7.4 | 8.4 | 26.2 | 3.3 | 5.4 |