Audio-Visual Event Classification on AudioSet Full
52.1Fusion mAPMBT
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| MBTtraining samples=500k, trained independently=false2022.07 | 52.1 | — | — | |
| Cross-Modal Attention Model2022.07 | 50.4 | — | — | |
| Modal-Independent Modeltrained independently=false2022.07 | 48.1 | — | — | |
| UAVMmodality-missing results=false2022.07 | 48 | — | — | |
| Attn Audio-Visualtrained independently=false2022.07 | 46.2 | — | — | |
| Perceivertrained independently=false2022.07 | 44.2 | — | — | |
| GBlendtrained independently=false2022.07 | 41.8 | — | — | |
| Attn Audio-Visualtrained independently=true2022.07 | — | 38.4 | 25.7 | |
| GBlendtrained independently=true2022.07 | — | 32.4 | 18.8 | |
| MBTtraining samples=500k, trained independently=true2022.07 | — | 44.3 | 32.3 | |
| Modal-Independent Modeltrained independently=true2022.07 | — | 45.5 | 26.8 | |
| Perceivertrained independently=true2022.07 | — | 38.4 | 25.8 | |
| UAVMmodality-missing results=true2022.07 | — | 45.6 | 27.4 |