Automatic Speech Recognition on Cantonese JCCOCC MoCA (dev)
27.23CEREnc&Dec Prompts
Evaluation Results
| Method | Links | |
|---|---|---|
| Enc&Dec PromptsModel=Whisper (LoRA), SD Param.=0.50M2026.06 | 27.23 | |
| Audio-Textual PromptsModel=Whisper (LoRA)2026.06 | 27.26 | |
| Enc Only PromptsModel=Whisper (LoRA), SD Param.=0.40M2026.06 | 27.5 | |
| Audio-Only PromptsModel=Whisper (LoRA)2026.06 | 28.22 | |
| Whisper (LoRA)Model=Whisper (LoRA)2026.06 | 28.68 | |
| Supervised (100%)Finetune Strategy=100% Sup.2026.06 | 28.68 | |
| Conformer Transducer with Only Speech ContextsModel=Conformer Transducer2026.06 | 29.12 | |
| RABModel=Whisper (LoRA)2026.06 | 29.35 | |
| x-vectorModel=Whisper (LoRA)2026.06 | 29.87 | |
| Incremental SAT systemFinetune Strategy=Semi-Sup., SAT=✓, TTA=✓2026.06 | 31.53 | |
| Incremental SI systemFinetune Strategy=Semi-Sup.2026.06 | 33.15 | |
| ECAPA-TDNNModel=Whisper (LoRA)2026.06 | 33.48 | |
| Semi-Supervised + SAT + TTAFinetune Strategy=Semi-Sup., SAT=✓, TTA=✓2026.06 | 33.63 | |
| Semi-Supervised (Random, Incr.)Finetune Strategy=Semi-Sup.2026.06 | 33.69 | |
| Semi-Supervised (Conf. Score)Finetune Strategy=Semi-Sup.2026.06 | 33.84 | |
| Semi-Supervised Baseline (Sys.3)Finetune Strategy=Semi-Sup.2026.06 | 34.17 | |
| Supervised (10%) + SAT + TTAFinetune Strategy=10% Sup., SAT=✓, TTA=✓2026.06 | 34.89 | |
| Supervised (10%)Finetune Strategy=10% Sup.2026.06 | 35.39 | |
| i-vectorModel=Whisper (LoRA)2026.06 | 39.04 |