Audio Recognition on AudioSet 2k (balanced)
35.6Top-1 AccuracyM2PT-Point
Evaluation Results
| Method | Links | |
|---|---|---|
| M2PT-PointModel=ViT-B, Training setting=Pretrained setting2024.01 | 35.6 | |
| M2PT-ImageModel=ViT-B, Training setting=Pretrained setting2024.01 | 35.6 | |
| M2PT-VideoModel=ViT-B, Training setting=Pretrained setting2024.01 | 35.5 | |
| AudioMAEModel=ViT-B, Training setting=Pretrained setting2024.01 | 35.3 | |
| ASTModel=ViT-B, Training setting=Pretrained setting2024.01 | 34.7 | |
| PSLAModel=CNN+Trans, Training setting=Pretrained setting2024.01 | 31.9 | |
| SSASTModel=ViT-B, Training setting=Pretrained setting2024.01 | 31 | |
| M2PT-PointModel=ViT-B, Training setting=From-scratch setting2024.01 | 11.4 | |
| Baseline (scratch)Model=ViT-B, Training setting=From-scratch setting2024.01 | 11 |