Emotion Recognition on CRM-D
73.4AccuracyM2D-CLAP stage1 2025
Evaluation Results
| Method | Links | |
|---|---|---|
| M2D-CLAP stage1 2025Audio enc. fine-tuning on AudioSet=false2025.03 | 73.4 | |
| M2D-CLAP stage1 2024Audio enc. fine-tuning on AudioSet=false2025.03 | 73.4 | |
| M2DAudio enc. fine-tuning on AudioSet=false2025.03 | 73 | |
| M2DNumber of Parameters=86M, Masking ratio=0.7, Target Feeding=masked patches, Linear Evaluation=true2024.04 | 73 | |
| M2DNumber of Parameters=86M, Masking ratio=0.6, Target Feeding=all patches, Linear Evaluation=true2024.04 | 72.7 | |
| M2DNumber of Parameters=86M, Masking ratio=0.7, Target Feeding=all patches, Linear Evaluation=true2024.04 | 72.5 | |
| ATST-FrameAudio enc. fine-tuning on AudioSet=false2025.03 | 72.3 | |
| M2DEvaluation protocol=Linear evaluation, Masking ratio=0.62022.10 | 71.7 | |
| M2DEvaluation protocol=Linear evaluation, Masking ratio=0.72022.10 | 71.6 | |
| M2DNumber of Parameters=86M, Masking ratio=0.6, Target Feeding=masked patches, Linear Evaluation=true2024.04 | 71.4 | |
| MSM-MAENumber of Parameters=86M, Masking ratio=0.75, Linear Evaluation=true2024.04 | 71.2 | |
| MSM-MAEEvaluation protocol=Linear evaluation2022.10 | 70.2 | |
| Cacophony (stage 1)Audio enc. fine-tuning on AudioSet=false2025.03 | 69.7 | |
| M2D-CLAP2025Audio enc. fine-tuning on AudioSet=true2025.03 | 69.7 | |
| M2DASAudio enc. fine-tuning on AudioSet=true2025.03 | 69.5 | |
| ATST-ClipAudio enc. fine-tuning on AudioSet=false2025.03 | 68.8 | |
| ATST BaseNumber of Parameters=86M, Linear Evaluation=true2024.04 | 68.8 | |
| ATST BaseEvaluation protocol=Linear evaluation, Variant=Base2022.10 | 68.6 | |
| BEATsiter3+Audio enc. fine-tuning on AudioSet=true2025.03 | 67.6 | |
| BEATSiter3+Number of Parameters=90M, Linear Evaluation=true2024.04 | 67.6 | |
| CEDAudio enc. fine-tuning on AudioSet=false2025.03 | 66.1 | |
| Wav2Vec2Evaluation protocol=Linear evaluation2022.10 | 65.5 | |
| BEATsiter3Audio enc. fine-tuning on AudioSet=false2025.03 | 64.7 | |
| BEATSiter3Number of Parameters=90M, Linear Evaluation=true2024.04 | 64.7 | |
| BYOL-AEvaluation protocol=Linear evaluation2022.10 | 63.8 | |
| BYOL-ANumber of Parameters=5.3M, Linear Evaluation=true2024.04 | 63.8 | |
| CLAP2023Audio enc. fine-tuning on AudioSet=true2025.03 | 62.5 | |
| AST-Fusion#5#12Evaluation protocol=Linear evaluation, Variant=#5#122022.10 | 60.7 | |
| AST-Fusion#5#12Number of Parameters=86M, Linear Evaluation=true2024.04 | 60.7 | |
| Cacophony (stage 2)Audio enc. fine-tuning on AudioSet=false2025.03 | 59.3 | |
| WavCapsAudio enc. fine-tuning on AudioSet=true2025.03 | 58.6 | |
| ASTAudio enc. fine-tuning on AudioSet=true2025.03 | 58.4 | |
| ASTNumber of Parameters=86M, Linear Evaluation=true2024.04 | 57.9 | |
| HTS-ATAudio enc. fine-tuning on AudioSet=true2025.03 | 56.2 | |
| HTS-ATNumber of Parameters=31M, Linear Evaluation=true2024.04 | 56.2 | |
| LAION-CLAPAudio enc. fine-tuning on AudioSet=true2025.03 | 54.6 | |
| CLAP2022Audio enc. fine-tuning on AudioSet=true2025.03 | 54.4 | |
| PANNs CNN14Audio enc. fine-tuning on AudioSet=true2025.03 | 51.8 | |
| PengiAudio enc. fine-tuning on AudioSet=true2025.03 | 50.57 |