Automatic Speech Recognition on MSP-Podcast (Test2)
0.1442WERCosyVoice2
Evaluation Results
| Method | Links | |
|---|---|---|
| CosyVoice2Strategy=TTS-EMO-G, Fine-tuning=AudioEnc2026.01 | 0.1442 | |
| CosyVoice2Strategy=EMO-G, Fine-tuning=AudioEnc2026.01 | 0.1449 | |
| CosyVoice2Strategy=Vanilla, Fine-tuning=AudioEnc2026.01 | 0.145 | |
| EmoVoiceStrategy=TTS-G, Fine-tuning=AudioEnc2026.01 | 0.1453 | |
| CosyVoice2Strategy=TTS-G, Fine-tuning=AudioEnc2026.01 | 0.1458 | |
| MaskGCTStrategy=TTS-EMO-G, Fine-tuning=AudioEnc2026.01 | 0.1517 | |
| MaskGCTStrategy=EMO-G, Fine-tuning=AudioEnc2026.01 | 0.1519 | |
| MaskGCTStrategy=Vanilla, Fine-tuning=AudioEnc2026.01 | 0.1528 | |
| Qwen2-AudioStrategy=Pretrained Baseline2026.01 | 0.1541 | |
| MaskGCTStrategy=TTS-G, Fine-tuning=AudioEnc2026.01 | 0.1598 | |
| EmoVoiceStrategy=EMO-G, Fine-tuning=AudioEnc2026.01 | 0.1818 | |
| EmoVoiceStrategy=TTS-EMO-G, Fine-tuning=AudioEnc2026.01 | 0.185 | |
| EmoVoiceStrategy=Vanilla, Fine-tuning=AudioEnc2026.01 | 0.2297 |