Automatic Speech Recognition on IEMOCAP
8.7WERMaskGCT
Evaluation Results
| Method | Links | |
|---|---|---|
| MaskGCTStrategy=TTS-EMO-G, Fine-tuning=AudioEnc2026.01 | 8.7 | |
| CosyVoice2Strategy=EMO-G, Fine-tuning=AudioEnc2026.01 | 8.91 | |
| MaskGCTStrategy=TTS-G, Fine-tuning=AudioEnc2026.01 | 8.92 | |
| Qwen2-AudioStrategy=Pretrained Baseline2026.01 | 9.27 | |
| CosyVoice2Strategy=TTS-G, Fine-tuning=AudioEnc2026.01 | 9.56 | |
| CosyVoice2Strategy=TTS-EMO-G, Fine-tuning=AudioEnc2026.01 | 9.56 | |
| MaskGCTStrategy=EMO-G, Fine-tuning=AudioEnc2026.01 | 9.9 | |
| CosyVoice2Strategy=Vanilla, Fine-tuning=AudioEnc2026.01 | 10.44 | |
| EmoVoiceStrategy=TTS-G, Fine-tuning=AudioEnc2026.01 | 10.9 | |
| MaskGCTStrategy=Vanilla, Fine-tuning=AudioEnc2026.01 | 11.16 | |
| EmoVoiceStrategy=TTS-EMO-G, Fine-tuning=AudioEnc2026.01 | 13.36 | |
| EmoVoiceStrategy=Vanilla, Fine-tuning=AudioEnc2026.01 | 13.8 | |
| EmoVoiceStrategy=EMO-G, Fine-tuning=AudioEnc2026.01 | 13.99 |