Emotion Recognition on RAVDESS
72AccuracyBLSP-Emo
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| BLSP-EmoModel Category=Emotion Focused Speech Large Language Models2026.01 | 72 | — | |
| EmotionThinkerModel Category=Omni Large Language Models2026.01 | 71.56 | — | |
| Qwen-Audio-ChatModel Category=General Speech Large Language Models2026.01 | 70.11 | — | |
| Audio-video (Gating Paradigm)Inputs=Audio-video (Gating Paradigm)2026.05 | 67.7 | — | |
| Concatenation of Audio (LSTM) and Video (LSTM)Inputs=Concatenation of Audio (LSTM) and Video (LSTM)2026.05 | 65.8 | — | |
| Audio-videoInputs=Audio-video2026.05 | 65.7 | — | |
| Qwen2-Audio-InstructModel Category=General Speech Large Language Models2026.01 | 64.98 | — | |
| Qwen2.5-Omni-7BModel Category=Omni Large Language Models2026.01 | 64.77 | — | |
| Gemini-2.5 Flash2026.03 | 61.4 | — | |
| Kimi-AudioModel Category=General Speech Large Language Models2026.01 | 61.07 | — | |
| Video Only (LSTM)Inputs=Video Only (LSTM)2026.05 | 60.5 | — | |
| Video OnlyInputs=Video Only2026.05 | 60.2 | — | |
| Video Only (Gating Paradigm)Inputs=Video Only (Gating Paradigm)2026.05 | 60.1 | — | |
| PALLMmode=CLS + GEN2026.03 | 59 | — | |
| PALLMmode=GEN ONLY2026.03 | 57 | — | |
| SFTmode=CLS + GEN2026.03 | 54 | — | |
| Audio OnlyInputs=Audio Only2026.05 | 50.1 | — | |
| SubTEvaluation Role=Source2026.06 | 48.67 | — | |
| SubT†Evaluation Role=Source2026.06 | 48.67 | — | |
| Audio Only (Gating Paradigm)Inputs=Audio Only (Gating Paradigm)2026.05 | 45.3 | — | |
| Gemini-2.5 Pro2026.03 | 44.2 | — | |
| CoCoOpEvaluation Role=Source2026.06 | 41.62 | — | |
| MiniCPM-OModel Category=Omni Large Language Models2026.01 | 40.93 | — | |
| Audio Only (LSTM)Inputs=Audio Only (LSTM)2026.05 | 40.1 | — | |
| DePTEvaluation Role=Source2026.06 | 38.49 | — | |
| CoOpEvaluation Role=Source2026.06 | 37.68 | — | |
| OSUM-EChatModel Category=Emotion Focused Speech Large Language Models2026.01 | 37.34 | — | |
| MERaLiON2Model Category=General Speech Large Language Models2026.01 | 37.02 | — | |
| SEPTEvaluation Role=Source2026.06 | 36.59 | — | |
| CLIP-AdapterEvaluation Role=Source2026.06 | 33.13 | — | |
| Zero-shotEvaluation Role=Source2026.06 | 28.51 | — | |
| SECapModel Category=Emotion Focused Speech Large Language Models2026.01 | 28.34 | — | |
| GPT4o-Audio2026.03 | 28.3 | — | |
| SFTmode=GEN ONLY2026.03 | 28 | — | |
| Qwen-2.52026.03 | 24.4 | — | |
| Gemma-3n2026.03 | 23.2 | — | |
| Megrez-3B-OmniModel Category=Omni Large Language Models2026.01 | 21.45 | — | |
| SALMONNModel Category=General Speech Large Language Models2026.01 | 20.38 | — | |
| Pengi2023.05 | 20.32 | — | |
| GLM-4-VoiceModel Category=General Speech Large Language Models2026.01 | 19.67 | — | |
| DIVAModel Category=General Speech Large Language Models2026.01 | 18.28 | — | |
| Phi-4-MultimodalModel Category=Omni Large Language Models2026.01 | 17.63 | — | |
| CLAP2023.05 | 15.99 | — | |
| MERaLiONModel Category=General Speech Large Language Models2026.01 | 12.43 | — | |
| KgCoOpEvaluation Role=Source2026.06 | 11.27 | — | |
| BLSPModel Category=General Speech Large Language Models2026.01 | 11.1 | — | |
| CoCoOpShots=16, Audio Encoder=CLAP-HTSAT, Text Encoder=CLIP (PENGI)2026.06 | — | 43.11 | |
| CoCoOp + ASPLShots=16, Audio Encoder=CLAP-HTSAT, Text Encoder=CLIP (PENGI)2026.06 | — | 46.64 | |
| CoCoOp + ASPL*Shots=16, Audio Encoder=CLAP-HTSAT, Text Encoder=CLIP (PENGI)2026.06 | — | 43.72 | |
| CoOpShots=16, Audio Encoder=CLAP-HTSAT, Text Encoder=CLIP (PENGI)2026.06 | — | 40.26 | |
| CoOp + ASPLShots=16, Audio Encoder=CLAP-HTSAT, Text Encoder=CLIP (PENGI)2026.06 | — | 42.09 | |
| CoOp + ASPL*Shots=16, Audio Encoder=CLAP-HTSAT, Text Encoder=CLIP (PENGI)2026.06 | — | 42.77 | |
| PALMShots=16, Audio Encoder=CLAP-HTSAT, Text Encoder=CLIP (PENGI)2026.06 | — | 46.16 | |
| PALM + ASPLShots=16, Audio Encoder=CLAP-HTSAT, Text Encoder=CLIP (PENGI)2026.06 | — | 49.76 | |
| PALM + ASPL*Shots=16, Audio Encoder=CLAP-HTSAT, Text Encoder=CLIP (PENGI)2026.06 | — | 48.2 |