Audio Classification on VC1
99.7AccuracyConformerXL-P Non-RA
Evaluation Results
| Method | Links | |
|---|---|---|
| ConformerXL-P Non-RAEvaluation protocol=Linear evaluation, Variant=Non-RA2022.10 | 99.7 | |
| ATST-C2FType=Reference model, Evaluation Protocol=Fine-tuning2025.03 | 97.5 | |
| ATST-FrameType=Audio model, Evaluation Protocol=Fine-tuning2025.03 | 97.3 | |
| M2DType=Baseline, Evaluation Protocol=Fine-tuning2025.03 | 96.3 | |
| ATST-ClipType=Audio model, Evaluation Protocol=Fine-tuning2025.03 | 95.5 | |
| M2D-CLAP2025 stage1Type=Audio-Language model, Evaluation Protocol=Fine-tuning2025.03 | 95.5 | |
| M2D-CLAP2024 stage1Type=Ablation, Evaluation Protocol=Fine-tuning2025.03 | 95.5 | |
| M2D-CLAP2025Type=Ablation, Config=Fine-tuned to AudioSet in stage 1.1, Evaluation Protocol=Fine-tuning2025.03 | 94 | |
| M2DEvaluation protocol=Linear evaluation, Masking ratio=0.62022.10 | 73.1 | |
| MSM-MAEEvaluation protocol=Linear evaluation2022.10 | 72.2 | |
| ATST BaseEvaluation protocol=Linear evaluation, Variant=Base2022.10 | 72 | |
| M2DEvaluation protocol=Linear evaluation, Masking ratio=0.72022.10 | 71.3 | |
| SF NFNet-F0Evaluation protocol=Linear evaluation2022.10 | 64.9 | |
| BYOL-AEvaluation protocol=Linear evaluation2022.10 | 57.8 | |
| DeLoRes-MEvaluation protocol=Linear evaluation2022.10 | 45.3 | |
| Wav2Vec2Evaluation protocol=Linear evaluation2022.10 | 40.9 | |
| AST-Fusion#5#12Evaluation protocol=Linear evaluation, Variant=#5#122022.10 | 24.9 |