Speech Recognition on Librispeech other (test)
2.2WERMing-Flash-Omni
Evaluation Results
| Method | Links | ||||||||
|---|---|---|---|---|---|---|---|---|---|
| Ming-Flash-Omni2025.10 | 2.2 | — | — | — | — | — | — | — | |
| Phi-4-Multimodal + RLBRN (Biasing list size)=1002026.01 | 2.25 | — | — | — | — | — | 2.11 | 2.26 | |
| Phi-4-Multimodal + SFTN (Biasing list size)=1002026.01 | 2.35 | — | — | — | — | — | 2.94 | 2.28 | |
| Kimi Audio2025.10 | 2.42 | — | — | — | — | — | — | — | |
| Qwen3 Omni2025.10 | 2.48 | — | — | — | — | — | — | — | |
| Phi-4-Multimodal + RLBRN (Biasing list size)=5002026.01 | 2.52 | — | — | — | — | — | 3.24 | 2.44 | |
| Phi-4-Multimodal + RLBRN (Biasing list size)=10002026.01 | 2.65 | — | — | — | — | — | 4.04 | 2.49 | |
| Phi-4-Multimodal + SFTN (Biasing list size)=5002026.01 | 2.71 | — | — | — | — | — | 5.17 | 2.42 | |
| CTC-Assisted LLMN (Biasing list size)=1002026.01 | 2.72 | — | — | — | — | — | 8.02 | 2.16 | |
| Phi-4-Multimodal + SFTN (Biasing list size)=10002026.01 | 2.88 | — | — | — | — | — | 6.41 | 2.47 | |
| CTC-Assisted LLMN (Biasing list size)=10002026.01 | 2.99 | — | — | — | — | — | 9.33 | 2.31 | |
| CTC-Assisted LLMN (Biasing list size)=5002026.01 | 3.04 | — | — | — | — | — | 9.04 | 2.4 | |
| Phi-4-MultimodalN (Biasing list size)=1002026.01 | 3.43 | — | — | — | — | — | 12.9 | 2.31 | |
| Qwen2 Audio2025.10 | 3.6 | — | — | — | — | — | — | — | |
| Phi-4-MultimodalN (Biasing list size)=02026.01 | 3.87 | — | — | — | — | — | 16.97 | 2.32 | |
| Phi-4-Multimodal + SFTN (Biasing list size)=02026.01 | 3.96 | — | — | — | — | — | 17.2 | 2.4 | |
| Phi-4-Multimodal + RLBRN (Biasing list size)=02026.01 | 4 | — | — | — | — | — | 17.37 | 2.42 | |
| CTC-Assisted LLMN (Biasing list size)=02026.01 | 4.18 | — | — | — | — | — | 20.02 | 2.49 | |
| Dynamic VocabularyN (Biasing list size)=1002026.01 | 4.63 | — | — | — | — | — | 7.1 | 4.3 | |
| Dynamic VocabularyN (Biasing list size)=5002026.01 | 4.81 | — | — | — | — | — | 7.9 | 4.5 | |
| Dynamic VocabularyN (Biasing list size)=10002026.01 | 4.97 | — | — | — | — | — | 8.5 | 4.6 | |
| Dynamic VocabularyN (Biasing list size)=02026.01 | 6.95 | — | — | — | — | — | 27.5 | 4.6 | |
| RelPosMHANumber of parameters=~315M, Language Model (LM) decoding=true, Pre-trained on LibriSpeech-960h=Yes, Fine-tuned on train-100=Yes2026.02 | 8.09 | — | — | — | — | — | — | — | |
| GT / GTN=3, Con_inf=GT, Con_train=GT, Dropout rate=02026.03 | 8.29 | — | — | — | — | — | — | — | |
| GT / GTN=2, Con_inf=GT, Con_train=GT, Dropout rate=02026.03 | 8.36 | — | — | — | — | — | — | — | |
| GT / GTN=2, Con_inf=GT, Con_train=GT, Dropout rate=0.52026.03 | 8.37 | — | — | — | — | — | — | — | |
| RoPE MHANumber of parameters=~315M, Language Model (LM) decoding=true, Pre-trained on LibriSpeech-960h=Yes, Fine-tuned on train-100=Yes2026.02 | 8.45 | — | — | — | — | — | — | — | |
| GT / GTN=4, Con_inf=GT, Con_train=GT, Dropout rate=02026.03 | 9.01 | — | — | — | — | — | — | — | |
| hyp / GTN=2, Con_inf=hyp, Con_train=GT, Dropout rate=0.52026.03 | 9.1 | — | — | — | — | — | — | — | |
| hyp / Whisper + DPON=2, Con_inf=hyp, Con_train=Whisper, Dropout rate=0.52026.03 | 9.19 | — | — | — | — | — | — | — | |
| hyp / Whisper + DPON=5, Con_inf=hyp, Con_train=Whisper, Dropout rate=0.52026.03 | 9.24 | — | — | — | — | — | — | — | |
| hyp / Whisper + DPON=4, Con_inf=hyp, Con_train=Whisper, Dropout rate=0.52026.03 | 9.25 | — | — | — | — | — | — | — | |
| hyp / Whisper + SFT2N=1, Con_inf=hyp, Con_train=Whisper, Dropout rate=0.52026.03 | 9.3 | — | — | — | — | — | — | — | |
| hyp / WhisperN=5, Con_inf=hyp, Con_train=Whisper, Dropout rate=0.52026.03 | 9.33 | — | — | — | — | — | — | — | |
| hyp / Whisper + SFT2N=5, Con_inf=hyp, Con_train=Whisper, Dropout rate=0.52026.03 | 9.33 | — | — | — | — | — | — | — | |
| hyp / Whisper + DPON=3, Con_inf=hyp, Con_train=Whisper, Dropout rate=0.52026.03 | 9.36 | — | — | — | — | — | — | — | |
| hyp / Whisper + DPON=1, Con_inf=hyp, Con_train=Whisper, Dropout rate=0.52026.03 | 9.38 | — | — | — | — | — | — | — | |
| hyp / WhisperN=1, Con_inf=hyp, Con_train=Whisper, Dropout rate=02026.03 | 9.46 | — | — | — | — | — | — | — | |
| hyp / Whisper + SFT2N=1, Con_inf=hyp, Con_train=Whisper, Dropout rate=02026.03 | 9.49 | — | — | — | — | — | — | — | |
| GT / GTN=5, Con_inf=GT, Con_train=GT, Dropout rate=02026.03 | 9.49 | — | — | — | — | — | — | — | |
| hyp / WhisperN=2, Con_inf=hyp, Con_train=Whisper, Dropout rate=0.52026.03 | 9.5 | — | — | — | — | — | — | — | |
| hyp / Whisper + DPON=2, Con_inf=hyp, Con_train=Whisper, Dropout rate=02026.03 | 9.51 | — | — | — | — | — | — | — | |
| hyp / Whisper + DPON=1, Con_inf=hyp, Con_train=Whisper, Dropout rate=02026.03 | 9.57 | — | — | — | — | — | — | — | |
| hyp / Whisper + SFT2N=2, Con_inf=hyp, Con_train=Whisper, Dropout rate=0.52026.03 | 9.66 | — | — | — | — | — | — | — | |
| GT / GTN=1, Con_inf=GT, Con_train=GT, Dropout rate=0.52026.03 | 9.68 | — | — | — | — | — | — | — | |
| hyp / WhisperN=4, Con_inf=hyp, Con_train=Whisper, Dropout rate=0.52026.03 | 9.82 | — | — | — | — | — | — | — | |
| - / -N=0, Con_inf=-, Con_train=-, Dropout rate=02026.03 | 9.83 | — | — | — | — | — | — | — | |
| hyp / Whisper + SFT2N=4, Con_inf=hyp, Con_train=Whisper, Dropout rate=0.52026.03 | 9.83 | — | — | — | — | — | — | — | |
| hyp / Whisper + DPON=5, Con_inf=hyp, Con_train=Whisper, Dropout rate=02026.03 | 9.85 | — | — | — | — | — | — | — | |
| hyp / GTN=2, Con_inf=hyp, Con_train=GT, Dropout rate=02026.03 | 9.88 | — | — | — | — | — | — | — | |
| hyp / GTN=1, Con_inf=hyp, Con_train=GT, Dropout rate=0.52026.03 | 9.94 | — | — | — | — | — | — | — | |
| hyp / WhisperN=1, Con_inf=hyp, Con_train=Whisper, Dropout rate=0.52026.03 | 9.96 | — | — | — | — | — | — | — | |
| hyp / Whisper + DPON=3, Con_inf=hyp, Con_train=Whisper, Dropout rate=02026.03 | 9.96 | — | — | — | — | — | — | — | |
| hyp / Whisper + DPON=4, Con_inf=hyp, Con_train=Whisper, Dropout rate=02026.03 | 9.97 | — | — | — | — | — | — | — | |
| GT / GTN=5, Con_inf=GT, Con_train=GT, Dropout rate=0.52026.03 | 10.04 | — | — | — | — | — | — | — | |
| hyp / Whisper + SFT2N=3, Con_inf=hyp, Con_train=Whisper, Dropout rate=0.52026.03 | 10.2 | — | — | — | — | — | — | — | |
| GT / GTN=4, Con_inf=GT, Con_train=GT, Dropout rate=0.52026.03 | 10.23 | — | — | — | — | — | — | — | |
| hyp / GTN=4, Con_inf=hyp, Con_train=GT, Dropout rate=0.52026.03 | 10.23 | — | — | — | — | — | — | — | |
| GT / GTN=1, Con_inf=GT, Con_train=GT, Dropout rate=02026.03 | 10.36 | — | — | — | — | — | — | — | |
| GT / GTN=3, Con_inf=GT, Con_train=GT, Dropout rate=0.52026.03 | 10.36 | — | — | — | — | — | — | — | |
| hyp / WhisperN=3, Con_inf=hyp, Con_train=Whisper, Dropout rate=0.52026.03 | 10.39 | — | — | — | — | — | — | — | |
| hyp / Whisper + SFT2N=3, Con_inf=hyp, Con_train=Whisper, Dropout rate=02026.03 | 10.49 | — | — | — | — | — | — | — | |
| hyp / Whisper + SFT2N=5, Con_inf=hyp, Con_train=Whisper, Dropout rate=02026.03 | 10.57 | — | — | — | — | — | — | — | |
| hyp / GTN=1, Con_inf=hyp, Con_train=GT, Dropout rate=02026.03 | 10.63 | — | — | — | — | — | — | — | |
| hyp / GTN=3, Con_inf=hyp, Con_train=GT, Dropout rate=02026.03 | 10.68 | — | — | — | — | — | — | — | |
| hyp / WhisperN=3, Con_inf=hyp, Con_train=Whisper, Dropout rate=02026.03 | 10.69 | — | — | — | — | — | — | — | |
| hyp / GTN=5, Con_inf=hyp, Con_train=GT, Dropout rate=02026.03 | 10.76 | — | — | — | — | — | — | — | |
| RelPosMHANumber of parameters=~315M, Language Model (LM) decoding=false, Pre-trained on LibriSpeech-960h=Yes, Fine-tuned on train-100=Yes2026.02 | 10.78 | — | — | — | — | — | — | — | |
| HyperConformerNumber of parameters=~315M, Language Model (LM) decoding=true, Pre-trained on LibriSpeech-960h=Yes, Fine-tuned on train-100=Yes2026.02 | 10.78 | — | — | — | — | — | — | — | |
| hyp / WhisperN=4, Con_inf=hyp, Con_train=Whisper, Dropout rate=02026.03 | 10.81 | — | — | — | — | — | — | — | |
| hyp / WhisperN=5, Con_inf=hyp, Con_train=Whisper, Dropout rate=02026.03 | 10.87 | — | — | — | — | — | — | — | |
| hyp / GTN=3, Con_inf=hyp, Con_train=GT, Dropout rate=0.52026.03 | 10.93 | — | — | — | — | — | — | — | |
| RoPE MHANumber of parameters=~315M, Language Model (LM) decoding=false, Pre-trained on LibriSpeech-960h=Yes, Fine-tuned on train-100=Yes2026.02 | 10.99 | — | — | — | — | — | — | — | |
| hyp / GTN=4, Con_inf=hyp, Con_train=GT, Dropout rate=02026.03 | 11.07 | — | — | — | — | — | — | — | |
| hyp / Whisper + SFT2N=2, Con_inf=hyp, Con_train=Whisper, Dropout rate=02026.03 | 11.17 | — | — | — | — | — | — | — | |
| hyp / GTN=5, Con_inf=hyp, Con_train=GT, Dropout rate=0.52026.03 | 11.29 | — | — | — | — | — | — | — | |
| PoM baseNumber of parameters=~315M, Language Model (LM) decoding=true, Pre-trained on LibriSpeech-960h=Yes, Fine-tuned on train-100=Yes2026.02 | 11.33 | — | — | — | — | — | — | — | |
| hyp / Whisper + SFT2N=4, Con_inf=hyp, Con_train=Whisper, Dropout rate=02026.03 | 11.34 | — | — | — | — | — | — | — | |
| RoPE MHANumber of parameters=~95M, Language Model (LM) decoding=true, Pre-trained on LibriSpeech-960h=Yes, Fine-tuned on train-100=Yes2026.02 | 11.98 | — | — | — | — | — | — | — | |
| hyp / WhisperN=2, Con_inf=hyp, Con_train=Whisper, Dropout rate=02026.03 | 12 | — | — | — | — | — | — | — | |
| RelPosMHANumber of parameters=~95M, Language Model (LM) decoding=true, Pre-trained on LibriSpeech-960h=Yes, Fine-tuned on train-100=Yes2026.02 | 12.13 | — | — | — | — | — | — | — | |
| MambaNumber of parameters=~315M, Language Model (LM) decoding=true, Pre-trained on LibriSpeech-960h=Yes, Fine-tuned on train-100=Yes2026.02 | 12.66 | — | — | — | — | — | — | — | |
| SummaryMixingNumber of parameters=~315M, Language Model (LM) decoding=true, Pre-trained on LibriSpeech-960h=Yes, Fine-tuned on train-100=Yes2026.02 | 12.97 | — | — | — | — | — | — | — | |
| HyperConformerNumber of parameters=~315M, Language Model (LM) decoding=false, Pre-trained on LibriSpeech-960h=Yes, Fine-tuned on train-100=Yes2026.02 | 13.13 | — | — | — | — | — | — | — | |
| regular MHANumber of parameters=~95M, Language Model (LM) decoding=true, Pre-trained on LibriSpeech-960h=Yes, Fine-tuned on train-100=Yes2026.02 | 13.47 | — | — | — | — | — | — | — | |
| PoM baseNumber of parameters=~95M, Language Model (LM) decoding=true, Pre-trained on LibriSpeech-960h=Yes, Fine-tuned on train-100=Yes2026.02 | 13.62 | — | — | — | — | — | — | — | |
| PoM baseNumber of parameters=~315M, Language Model (LM) decoding=false, Pre-trained on LibriSpeech-960h=Yes, Fine-tuned on train-100=Yes2026.02 | 14.86 | — | — | — | — | — | — | — | |
| HyperConformerNumber of parameters=~95M, Language Model (LM) decoding=true, Pre-trained on LibriSpeech-960h=Yes, Fine-tuned on train-100=Yes2026.02 | 15.03 | — | — | — | — | — | — | — | |
| MambaNumber of parameters=~95M, Language Model (LM) decoding=true, Pre-trained on LibriSpeech-960h=Yes, Fine-tuned on train-100=Yes2026.02 | 15.37 | — | — | — | — | — | — | — | |
| MambaNumber of parameters=~315M, Language Model (LM) decoding=false, Pre-trained on LibriSpeech-960h=Yes, Fine-tuned on train-100=Yes2026.02 | 15.47 | — | — | — | — | — | — | — | |
| SummaryMixingNumber of parameters=~95M, Language Model (LM) decoding=true, Pre-trained on LibriSpeech-960h=Yes, Fine-tuned on train-100=Yes2026.02 | 15.84 | — | — | — | — | — | — | — | |
| RoPE MHANumber of parameters=~95M, Language Model (LM) decoding=false, Pre-trained on LibriSpeech-960h=Yes, Fine-tuned on train-100=Yes2026.02 | 17.53 | — | — | — | — | — | — | — | |
| SummaryMixingNumber of parameters=~315M, Language Model (LM) decoding=false, Pre-trained on LibriSpeech-960h=Yes, Fine-tuned on train-100=Yes2026.02 | 17.6 | — | — | — | — | — | — | — | |
| RelPosMHANumber of parameters=~95M, Language Model (LM) decoding=false, Pre-trained on LibriSpeech-960h=Yes, Fine-tuned on train-100=Yes2026.02 | 17.61 | — | — | — | — | — | — | — | |
| FastFormerNumber of parameters=~95M, Language Model (LM) decoding=true, Pre-trained on LibriSpeech-960h=Yes, Fine-tuned on train-100=Yes2026.02 | 17.95 | — | — | — | — | — | — | — | |
| PoM baseNumber of parameters=~95M, Language Model (LM) decoding=false, Pre-trained on LibriSpeech-960h=Yes, Fine-tuned on train-100=Yes2026.02 | 19.06 | — | — | — | — | — | — | — | |
| HyperConformerNumber of parameters=~95M, Language Model (LM) decoding=false, Pre-trained on LibriSpeech-960h=Yes, Fine-tuned on train-100=Yes2026.02 | 19.29 | — | — | — | — | — | — | — | |
| regular MHANumber of parameters=~95M, Language Model (LM) decoding=false, Pre-trained on LibriSpeech-960h=Yes, Fine-tuned on train-100=Yes2026.02 | 19.44 | — | — | — | — | — | — | — | |
| MambaNumber of parameters=~95M, Language Model (LM) decoding=false, Pre-trained on LibriSpeech-960h=Yes, Fine-tuned on train-100=Yes2026.02 | 19.97 | — | — | — | — | — | — | — | |
| FastFormerNumber of parameters=~95M, Language Model (LM) decoding=false, Pre-trained on LibriSpeech-960h=Yes, Fine-tuned on train-100=Yes2026.02 | 22.75 | — | — | — | — | — | — | — |