Music Genre Classification on GTZAN (test)
96AccuracyLAION-CLAP
Evaluation Results
| Method | Links | |
|---|---|---|
| LAION-CLAPzero-shot=true2024.06 | 96 | |
| Explicit Dropout (K)Dropout on Attention Sequence=Explicit (K), Dropout on FF network=Explicit, Dropout ratio=0.2, Model Architecture=2-layer Transformer encoder2026.04 | 85.78 | |
| Explicit Dropout (Q)Dropout on Attention Sequence=Explicit (Q), Dropout on FF network=Explicit, Dropout ratio=0.2, Model Architecture=2-layer Transformer encoder2026.04 | 85.68 | |
| Arora et al. (Q)Dropout on Attention Sequence=(Q) Arora et al. [1], Dropout on FF network=Explicit, Dropout ratio=0.2, Model Architecture=2-layer Transformer encoder2026.04 | 85.31 | |
| Arora et al. (V)Dropout on Attention Sequence=(V) Arora et al. [1], Dropout on FF network=Explicit, Dropout ratio=0.2, Model Architecture=2-layer Transformer encoder2026.04 | 85.16 | |
| Explicit Dropout (None)Dropout on Attention Sequence=None, Dropout on FF network=Explicit, Dropout ratio=0.2, Model Architecture=2-layer Transformer encoder2026.04 | 85.16 | |
| None (Implicit)Dropout on Attention Sequence=None, Dropout on FF network=Implicit, Dropout ratio=0.2, Model Architecture=2-layer Transformer encoder2026.04 | 85 | |
| Explicit Dropout (V)Dropout on Attention Sequence=Explicit (V), Dropout on FF network=Explicit, Dropout ratio=0.2, Model Architecture=2-layer Transformer encoder2026.04 | 85 | |
| Explicit Dropout (AV)Dropout on Attention Sequence=Explicit (AV), Dropout on FF network=Explicit, Dropout ratio=0.2, Model Architecture=2-layer Transformer encoder2026.04 | 85 | |
| DropAttentionDropout on Attention Sequence=DropAttention, Dropout on FF network=Implicit, Dropout ratio=0.2, Model Architecture=2-layer Transformer encoder2026.04 | 84.84 | |
| DropKeyDropout on Attention Sequence=DropKey, Dropout on FF network=Implicit, Dropout ratio=0.2, Model Architecture=2-layer Transformer encoder2026.04 | 84.84 | |
| Arora et al. (FF)Dropout on Attention Sequence=None, Dropout on FF network=Arora et al. [1], Dropout ratio=0.2, Model Architecture=2-layer Transformer encoder2026.04 | 84.84 | |
| Arora et al. (K)Dropout on Attention Sequence=(K) Arora et al. [1], Dropout on FF network=Explicit, Dropout ratio=0.2, Model Architecture=2-layer Transformer encoder2026.04 | 84.22 | |
| Proposed DNN classifierFeature Extractor=BYOL-A embeddings2026.03 | 81.5 | |
| Proposed DNN classifierTraining Dataset=GTZAN2026.03 | 81.5 | |
| Proposed DNN classifierFeature Extractor=VGGish embeddings2026.03 | 79.5 | |
| Proposed DNN classifierTraining Dataset=GTZAN + FMA-Small2026.03 | 78 | |
| Proposed DNN classifierFeature Extractor=PANNs embeddings2026.03 | 77 | |
| M2D-CLAPmasking_ratio=0.7, zero-shot=true2024.06 | 75.17 | |
| Niizumi et al.2026.03 | 70.1 | |
| Niizumi et al.2026.03 | 70.1 | |
| WavCapszero-shot=true2024.06 | 52.1 | |
| JMLAzero-shot=false, note=Used test task data during training2024.06 | 50.3 | |
| Proto-LCzero-shot=true2024.06 | 47.24 | |
| AudioCLIPzero-shot=false, note=Used test task data during training2024.06 | 45.52 | |
| Pengizero-shot=true2024.06 | 28.97 | |
| Wav2CLIPzero-shot=true2024.06 | 27.66 |