Automatic Speech Recognition on MSP-Podcast (Test1)
15.6WERMaskGCT
Evaluation Results
| Method | Links | |
|---|---|---|
| MaskGCTStrategy=TTS-EMO-G, Fine-tuning=AudioEnc2026.01 | 15.6 | |
| MaskGCTStrategy=TTS-G, Fine-tuning=AudioEnc2026.01 | 15.77 | |
| Qwen2-AudioStrategy=Pretrained Baseline2026.01 | 15.78 | |
| CosyVoice2Strategy=TTS-EMO-G, Fine-tuning=AudioEnc2026.01 | 16.01 | |
| EmoVoiceStrategy=TTS-G, Fine-tuning=AudioEnc2026.01 | 16.11 | |
| MaskGCTStrategy=Vanilla, Fine-tuning=AudioEnc2026.01 | 16.2 | |
| CosyVoice2Strategy=Vanilla, Fine-tuning=AudioEnc2026.01 | 16.85 | |
| CosyVoice2Strategy=TTS-G, Fine-tuning=AudioEnc2026.01 | 16.92 | |
| CosyVoice2Strategy=EMO-G, Fine-tuning=AudioEnc2026.01 | 17.25 | |
| MaskGCTStrategy=EMO-G, Fine-tuning=AudioEnc2026.01 | 17.43 | |
| EmoVoiceStrategy=TTS-EMO-G, Fine-tuning=AudioEnc2026.01 | 19.7 | |
| EmoVoiceStrategy=EMO-G, Fine-tuning=AudioEnc2026.01 | 20.92 | |
| EmoVoiceStrategy=Vanilla, Fine-tuning=AudioEnc2026.01 | 22.71 |