Audio Classification on AudioSet Full (test)
45.9mAPAST (w/o ensemble)
Evaluation Results
| Method | Links | |
|---|---|---|
| AST (w/o ensemble)Pre-training strategy=Supervised (ImageNet), Input forms=logmel, Fine-tuned=true2021.10 | 45.9 | |
| ASTMACs (G)=103.4, #Params (million)=88.12023.03 | 45.9 | |
| ERANNPre-training strategy=No pre-training (From scratch), Input forms=logmel2021.10 | 45 | |
| PSLA (w/o ensemble)Pre-training strategy=Supervised (ImageNet), Input forms=waveform + logmel, Fine-tuned=true2021.10 | 44.4 | |
| PSLA2023.03 | 44.4 | |
| MBT (AST)MACs (G)=103.4, #Params (million)=88.12023.03 | 44.3 | |
| PANNs2023.03 | 43.9 | |
| PANNSPre-training strategy=No pre-training (From scratch), Input forms=waveform + logmel2021.10 | 43.1 | |
| Multimodal COLAPre-training strategy=Multimodal Self-supervised, Input forms=waveform + logmel + video, AudioSet pre-train=true2021.10 | 42.4 | |
| cf_LPre-training strategy=Audio-only Self-supervised, Input forms=logmel, AudioSet pre-train=false, Fine-tuned=true2021.10 | 41.1 | |
| WEANet-SUSTAINPre-training strategy=No pre-training (From scratch), Input forms=logmel2021.10 | 39.8 | |
| VATTPre-training strategy=Multimodal Self-supervised, Input forms=logmel + video + text, AudioSet pre-train=true2021.10 | 39.4 | |
| MASTMACs (G)=25.6, #Params (million)=51.32023.03 | 39 | |
| AST (Our AS)Evaluation Protocol=Our AS (Downloaded AudioSet), MACs (G)=103.4, #Params (million)=88.12023.03 | 38.9 | |
| TALNetPre-training strategy=No pre-training (From scratch), Input forms=logmel2021.10 | 38.3 | |
| Multi-FormatPre-training strategy=Audio-only Self-supervised, Input forms=waveform + logmel, AudioSet pre-train=true2021.10 | 32.9 | |
| Separation-basedPre-training strategy=Audio-only Self-supervised, Input forms=logmel, AudioSet pre-train=true2021.10 | 32.6 | |
| Baseline2023.03 | 31.4 | |
| MMVPre-training strategy=Multimodal Self-supervised, Input forms=logmel + video + text, AudioSet pre-train=true2021.10 | 30.9 | |
| C³Pre-training strategy=Multimodal Self-supervised, Input forms=logmel + video2021.10 | 28.5 | |
| CPCPre-training strategy=Audio-only Self-supervised, Input forms=logmel2021.10 | 27.7 | |
| TripletPre-training strategy=Audio-only Self-supervised, Input forms=waveform2021.10 | 25.9 | |
| C³Pre-training strategy=Audio-only Self-supervised, Input forms=logmel2021.10 | 20.6 |