Automatic Speech Recognition on CommonVoice (test)
0.46WERMMS
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| MMSModel=MMS2026.06 | 0.46 | — | 0.36 | -23 | |
| Whisper-largeModel=Whisper-large2026.06 | 0.86 | — | 0.82 | -4.3 | |
| Whisper-smallModel=Whisper-small2026.06 | 1.46 | — | 1.36 | -6.9 | |
| dLLM-ASRDecoder Params=8.02B2026.01 | 8.36 | 0.057 | — | — | |
| Whisper-LLaMA3Decoder Params=8.03B2026.01 | 8.55 | 0.203 | — | — | |
| Whisper-LLaDADecoder Params=8.02B2026.01 | 8.8 | 2.029 | — | — | |
| Whisper-Qwen3Decoder Params=8.19B2026.01 | 9.18 | 0.355 | — | — | |
| Multi-Embedding Subset Selection (Conformer-Large)Subset=5%, Model=Conformer-Large, Approach=MMR, Embedding=Fusion2026.03 | 23.6 | — | — | — | |
| Conformer-Large (Full)Subset=Full, Model=Conformer-Large2026.03 | 25.4 | — | — | — | |
| Multi-Embedding Subset Selection + Fine-TuneSubset=5%, Model=Conformer-Small, Approach=+ Fine-Tune, Embedding=Fusion2026.03 | 31.8 | — | — | — | |
| Random (Baseline) + Fine-TuneSubset=5%, Model=Conformer-Small, Approach=+ Fine-Tune2026.03 | 33.6 | — | — | — | |
| MMR-based Data SelectionSubset=5%, Model=Conformer-Small, Approach=MMR, Embedding=WavLM2026.03 | 33.6 | — | — | — | |
| Multi-Embedding Subset SelectionSubset=5%, Model=Conformer-Small, Approach=MMR, Embedding=Fusion2026.03 | 34 | — | — | — | |
| MMR-based Data SelectionSubset=5%, Model=Conformer-Small, Approach=MMR, Embedding=Speaker2026.03 | 34.4 | — | — | — | |
| MMR-based Data SelectionSubset=5%, Model=Conformer-Small, Approach=MMR, Embedding=SBERT2026.03 | 35.7 | — | — | — | |
| Duration (Baseline)Subset=5%, Model=Conformer-Small, Approach=Duration (Baseline)2026.03 | 36.5 | — | — | — | |
| Conformer-Small (Full)Subset=Full, Model=Conformer-Small2026.03 | 36.6 | — | — | — | |
| Random (Baseline)Subset=5%, Model=Conformer-Small, Approach=Random (Baseline)2026.03 | 37.1 | — | — | — |