Automatic Speech Recognition on OpenASR
5.76Average WERUnified DM + MCR-RNNT 0.6B (larger right cont.)
Evaluation Results
| Method | Links | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| Unified DM + MCR-RNNT 0.6B (larger right cont.)Model Size=~600M params, Training Data=240k hours of PC data, Inference Mode=Offline2026.04 | 5.76 | — | — | — | — | — | — | — | — | |
| Unified DM + MCR-RNNT 0.6B (balanced)Model Size=~600M params, Training Data=240k hours of PC data, Inference Mode=Offline2026.04 | 5.91 | — | — | — | — | — | — | — | — | |
| Nemotron 3 Nano OmniOpen-Source=true, Size=30B-A3B, Reasoning mode=Reasoning off2026.04 | 5.95 | 11.09 | 11.27 | 9.66 | 1.98 | 3.44 | 1.57 | 2.96 | 5.6 | |
| Unified DM + MCR-RNNT 0.6B (larger right cont.)Model Size=~600M params, Training Data=240k hours of PC data, Inference Mode=Streaming, Latency=2.08s2026.04 | 5.97 | — | — | — | — | — | — | — | — | |
| SpeechKVCompression Ratio (R)=4, Compression Method=In-LLM, l0=52026.07 | 5.98 | 9.68 | 8.6 | 9.37 | 2.03 | — | 1.79 | 4.05 | 6.36 | |
| Window Q-FormerCompression Ratio (R)=4, Compression Method=Adapter-level2026.07 | 6.02 | 9.28 | 8.93 | 9.54 | 2.04 | — | 1.85 | 4.07 | 6.43 | |
| Parakeet-TDT-0.6b-v2Model Size=~600M params, Training Data=240k hours of PC data, Inference Mode=Offline2026.04 | 6.04 | — | — | — | — | — | — | — | — | |
| SpeechKVCompression Ratio (R)=8, Compression Method=In-LLM, l0=52026.07 | 6.05 | 9.37 | 8.84 | 9.59 | 2.13 | — | 1.86 | 4.12 | 6.45 | |
| HS CompressionCompression Ratio (R)=4, Compression Method=In-LLM, l0=52026.07 | 6.06 | 9.53 | 8.85 | 9.54 | 2.08 | — | 1.85 | 4.1 | 6.44 | |
| Concat-MLPCompression Ratio (R)=4, Compression Method=Adapter-level2026.07 | 6.07 | 9.65 | 8.71 | 9.55 | 2.08 | — | 1.86 | 4.09 | 6.52 | |
| MLP (Baseline)2026.07 | 6.12 | 10.59 | 8.59 | 9.44 | 2.02 | — | 1.83 | 4.03 | 6.36 | |
| Unified DM + MCR-RNNT 0.6B (larger right cont.)Model Size=~600M params, Training Data=240k hours of PC data, Inference Mode=Streaming, Latency=1.12s2026.04 | 6.14 | — | — | — | — | — | — | — | — | |
| Unified DM + MCR-RNNT 0.6B (balanced)Model Size=~600M params, Training Data=240k hours of PC data, Inference Mode=Streaming, Latency=2.08s2026.04 | 6.14 | — | — | — | — | — | — | — | — | |
| Unified DM + MCR-RNNT 0.6B (balanced)Model Size=~600M params, Training Data=240k hours of PC data, Inference Mode=Streaming, Latency=1.12s2026.04 | 6.29 | — | — | — | — | — | — | — | — | |
| HS CompressionCompression Ratio (R)=8, Compression Method=In-LLM, l0=52026.07 | 6.31 | 9.8 | 9.34 | 9.85 | 2.23 | — | 1.94 | 4.33 | 6.66 | |
| Parakeet-TDT-0.6B-v32026.06 | 6.32 | 11.39 | 11.19 | 9.57 | 3.98 | 2.8 | 1.92 | 3.59 | 6.09 | |
| Concat-MLPCompression Ratio (R)=8, Compression Method=Adapter-level2026.07 | 6.43 | 10.24 | 9.27 | 9.95 | 2.22 | — | 2 | 4.43 | 6.92 | |
| Unified DM + MCR-RNNT 0.6B (larger right cont.)Model Size=~600M params, Training Data=240k hours of PC data, Inference Mode=Streaming, Latency=0.56s2026.04 | 6.44 | — | — | — | — | — | — | — | — | |
| Baseline (Offline)Model Size=~128M params, Training Data=120k hours of norm data, Inference Mode=Offline2026.04 | 6.47 | — | — | — | — | — | — | — | — | |
| Unified DM + MCR-RNNT 0.6B (balanced)Model Size=~600M params, Training Data=240k hours of PC data, Inference Mode=Streaming, Latency=0.56s2026.04 | 6.52 | — | — | — | — | — | — | — | — | |
| Qwen3-OmniOpen-Source=true, Size=30B-A3B, Reasoning mode=Reasoning off2026.04 | 6.55 | 12.52 | 12.3 | 8.49 | 3.69 | 2.38 | 1.52 | 3.22 | 8.26 | |
| Phi4-mm2026.07 | 6.6 | 11.69 | 10.16 | 9.78 | 3.13 | — | 1.68 | 3.83 | 5.91 | |
| Unified DM + MCR-RNNTModel Size=~128M params, Training Data=120k hours of norm data, Inference Mode=Offline2026.04 | 6.63 | — | — | — | — | — | — | — | — | |
| Window Q-FormerCompression Ratio (R)=8, Compression Method=Adapter-level2026.07 | 6.64 | 12.02 | 9.2 | 9.96 | 2.2 | — | 1.91 | 4.48 | 6.72 | |
| Unified single-mode (SM)Model Size=~128M params, Training Data=120k hours of norm data, Inference Mode=Offline2026.04 | 6.66 | — | — | — | — | — | — | — | — | |
| Unified dual-mode (DM)Model Size=~128M params, Training Data=120k hours of norm data, Inference Mode=Offline2026.04 | 6.69 | — | — | — | — | — | — | — | — | |
| Unified DM + MCR-RNNT 0.6B (balanced)Model Size=~600M params, Training Data=240k hours of PC data, Inference Mode=Streaming, Latency=0.40s2026.04 | 6.7 | — | — | — | — | — | — | — | — | |
| TRADEStreaming mode=false2026.06 | 6.71 | 14.85 | 11.02 | 10.24 | 2.36 | 3.84 | 1.6 | 3.13 | 6.6 | |
| Unified DM + MCR-RNNTModel Size=~128M params, Training Data=120k hours of norm data, Inference Mode=Streaming, Latency=2.08s2026.04 | 6.86 | — | — | — | — | — | — | — | — | |
| Decoder-only LLMStreaming mode=false2026.06 | 6.87 | 16.16 | 11.51 | 10.07 | 2.23 | 3.71 | 1.7 | 3.01 | 6.59 | |
| Baseline (Offline)Model Size=~128M params, Training Data=120k hours of norm data, Inference Mode=Streaming, Latency=2.08s2026.04 | 6.92 | — | — | — | — | — | — | — | — | |
| Unified DM + MCR-RNNT 0.6B (balanced)Model Size=~600M params, Training Data=240k hours of PC data, Inference Mode=Streaming, Latency=0.32s2026.04 | 6.92 | — | — | — | — | — | — | — | — | |
| Unified DM + MCR-RNNT 0.6B (larger right cont.)Model Size=~600M params, Training Data=240k hours of PC data, Inference Mode=Streaming, Latency=0.40s2026.04 | 6.96 | — | — | — | — | — | — | — | — | |
| Nemotron-Speech-Streaming-En-0.6bModel Size=~600M params, Training Data=240k hours of PC data, Inference Mode=Offline2026.04 | 7.05 | — | — | — | — | — | — | — | — | |
| Nemotron-Speech-Streaming-En-0.6bModel Size=~600M params, Training Data=240k hours of PC data, Inference Mode=Streaming, Latency=1.12s2026.04 | 7.08 | — | — | — | — | — | — | — | — | |
| Unified DM + MCR-RNNTModel Size=~128M params, Training Data=120k hours of norm data, Inference Mode=Streaming, Latency=1.12s2026.04 | 7.09 | — | — | — | — | — | — | — | — | |
| Unified dual-mode (DM)Model Size=~128M params, Training Data=120k hours of norm data, Inference Mode=Streaming, Latency=2.08s2026.04 | 7.14 | — | — | — | — | — | — | — | — | |
| Canary-1B-v22026.06 | 7.15 | 16.01 | 11.79 | 10.82 | 2.28 | 4.29 | 2.18 | 3.56 | 6.25 | |
| Nemotron-Speech-Streaming-En-0.6bModel Size=~600M params, Training Data=240k hours of PC data, Inference Mode=Streaming, Latency=0.56s2026.04 | 7.22 | — | — | — | — | — | — | — | — | |
| Unified DM + MCR-RNNT 0.6B (balanced)Model Size=~600M params, Training Data=240k hours of PC data, Inference Mode=Streaming, Latency=0.24s2026.04 | 7.35 | — | — | — | — | — | — | — | — | |
| Whisper-large-v32026.06 | 7.44 | 15.95 | 11.29 | 10.02 | 2.94 | 3.86 | 2.01 | 3.91 | 9.54 | |
| Unified single-mode (SM)Model Size=~128M params, Training Data=120k hours of norm data, Inference Mode=Streaming, Latency=1.12s2026.04 | 7.46 | — | — | — | — | — | — | — | — | |
| Unified DM + MCR-RNNTModel Size=~128M params, Training Data=120k hours of norm data, Inference Mode=Streaming, Latency=0.56s2026.04 | 7.47 | — | — | — | — | — | — | — | — | |
| Unified dual-mode (DM)Model Size=~128M params, Training Data=120k hours of norm data, Inference Mode=Streaming, Latency=1.12s2026.04 | 7.48 | — | — | — | — | — | — | — | — | |
| Nemotron-Speech-Streaming-En-0.6bModel Size=~600M params, Training Data=240k hours of PC data, Inference Mode=Streaming, Latency=2.08s2026.04 | 7.51 | — | — | — | — | — | — | — | — | |
| Unified single-mode (SM)Model Size=~128M params, Training Data=120k hours of norm data, Inference Mode=Streaming, Latency=2.08s2026.04 | 7.71 | — | — | — | — | — | — | — | — | |
| Unified DM + MCR-RNNT 0.6B (larger right cont.)Model Size=~600M params, Training Data=240k hours of PC data, Inference Mode=Streaming, Latency=0.32s2026.04 | 7.72 | — | — | — | — | — | — | — | — | |
| Baseline (Streaming)Model Size=~128M params, Training Data=120k hours of norm data, Inference Mode=Offline2026.04 | 7.75 | — | — | — | — | — | — | — | — | |
| Nemotron-Speech-Streaming-En-0.6bModel Size=~600M params, Training Data=240k hours of PC data, Inference Mode=Streaming, Latency=0.32s2026.04 | 7.78 | — | — | — | — | — | — | — | — | |
| Unified DM + MCR-RNNTModel Size=~128M params, Training Data=120k hours of norm data, Inference Mode=Streaming, Latency=0.40s2026.04 | 7.83 | — | — | — | — | — | — | — | — | |
| Mamba2 + DCConv (Streaming)Model Size=~128M params, Training Data=120k hours of norm data, Inference Mode=Offline2026.04 | 7.89 | — | — | — | — | — | — | — | — | |
| Nemotron-Speech-Streaming-En-0.6bModel Size=~600M params, Training Data=240k hours of PC data, Inference Mode=Streaming, Latency=0.16s2026.04 | 7.92 | — | — | — | — | — | — | — | — | |
| Whisper-L-v32026.07 | 7.95 | 15.95 | 11.29 | 10.02 | 2.94 | — | 2.01 | 3.91 | 9.54 | |
| Unified single-mode (SM)Model Size=~128M params, Training Data=120k hours of norm data, Inference Mode=Streaming, Latency=0.56s2026.04 | 7.98 | — | — | — | — | — | — | — | — | |
| Parakeet-TDT-0.6b-v2Model Size=~600M params, Training Data=240k hours of PC data, Inference Mode=Streaming, Latency=2.08s2026.04 | 7.99 | — | — | — | — | — | — | — | — | |
| Baseline (Streaming)Model Size=~128M params, Training Data=120k hours of norm data, Inference Mode=Streaming, Latency=1.12s2026.04 | 8.02 | — | — | — | — | — | — | — | — | |
| Unified dual-mode (DM)Model Size=~128M params, Training Data=120k hours of norm data, Inference Mode=Streaming, Latency=0.56s2026.04 | 8.12 | — | — | — | — | — | — | — | — | |
| Nemotron-Speech-Streaming-En-0.6bModel Size=~600M params, Training Data=240k hours of PC data, Inference Mode=Streaming, Latency=0.24s2026.04 | 8.18 | — | — | — | — | — | — | — | — | |
| Baseline (Offline)Model Size=~128M params, Training Data=120k hours of norm data, Inference Mode=Streaming, Latency=1.12s2026.04 | 8.21 | — | — | — | — | — | — | — | — | |
| Unified DM + MCR-RNNTModel Size=~128M params, Training Data=120k hours of norm data, Inference Mode=Streaming, Latency=0.32s2026.04 | 8.24 | — | — | — | — | — | — | — | — | |
| Baseline (Streaming)Model Size=~128M params, Training Data=120k hours of norm data, Inference Mode=Streaming, Latency=0.56s2026.04 | 8.36 | — | — | — | — | — | — | — | — | |
| Baseline (Streaming)Model Size=~128M params, Training Data=120k hours of norm data, Inference Mode=Streaming, Latency=2.08s2026.04 | 8.39 | — | — | — | — | — | — | — | — | |
| TRADEStreaming mode=true, Chunk size=960 ms2026.06 | 8.4 | 17.16 | 15.62 | 11.07 | 4.42 | 4.61 | 2 | 4.07 | 8.22 | |
| Mamba2 + DCConv (Streaming)Model Size=~128M params, Training Data=120k hours of norm data, Inference Mode=Streaming, Latency=2.08s2026.04 | 8.41 | — | — | — | — | — | — | — | — | |
| Unified DM + MCR-RNNT 0.6B (balanced)Model Size=~600M params, Training Data=240k hours of PC data, Inference Mode=Streaming, Latency=0.16s2026.04 | 8.44 | — | — | — | — | — | — | — | — | |
| Mamba2 + DCConv (Streaming)Model Size=~128M params, Training Data=120k hours of norm data, Inference Mode=Streaming, Latency=1.12s2026.04 | 8.62 | — | — | — | — | — | — | — | — | |
| Mamba2 + DCConv (Streaming)Model Size=~128M params, Training Data=120k hours of norm data, Inference Mode=Streaming, Latency=0.40s2026.04 | 8.66 | — | — | — | — | — | — | — | — | |
| Mamba2 + DCConv (Streaming)Model Size=~128M params, Training Data=120k hours of norm data, Inference Mode=Streaming, Latency=0.56s2026.04 | 8.68 | — | — | — | — | — | — | — | — | |
| Mamba2 + DCConv (Streaming)Model Size=~128M params, Training Data=120k hours of norm data, Inference Mode=Streaming, Latency=0.32s2026.04 | 8.95 | — | — | — | — | — | — | — | — | |
| Unified DM + MCR-RNNTModel Size=~128M params, Training Data=120k hours of norm data, Inference Mode=Streaming, Latency=0.24s2026.04 | 9.04 | — | — | — | — | — | — | — | — | |
| TRADEStreaming mode=true, Chunk size=640 ms2026.06 | 9.35 | 18.04 | 16.23 | 11.25 | 4.6 | 4.98 | 2.29 | 5 | 9.35 | |
| Unified single-mode (SM)Model Size=~128M params, Training Data=120k hours of norm data, Inference Mode=Streaming, Latency=0.40s2026.04 | 9.4 | — | — | — | — | — | — | — | — | |
| Baseline (Streaming)Model Size=~128M params, Training Data=120k hours of norm data, Inference Mode=Streaming, Latency=0.32s2026.04 | 9.44 | — | — | — | — | — | — | — | — | |
| Unified DM + MCR-RNNT 0.6B (larger right cont.)Model Size=~600M params, Training Data=240k hours of PC data, Inference Mode=Streaming, Latency=0.24s2026.04 | 9.51 | — | — | — | — | — | — | — | — | |
| Mamba2 + DCConv (Streaming)Model Size=~128M params, Training Data=120k hours of norm data, Inference Mode=Streaming, Latency=0.24s2026.04 | 9.53 | — | — | — | — | — | — | — | — | |
| Baseline (Streaming)Model Size=~128M params, Training Data=120k hours of norm data, Inference Mode=Streaming, Latency=0.16s2026.04 | 9.84 | — | — | — | — | — | — | — | — | |
| Unified dual-mode (DM)Model Size=~128M params, Training Data=120k hours of norm data, Inference Mode=Streaming, Latency=0.40s2026.04 | 9.86 | — | — | — | — | — | — | — | — | |
| Baseline (Streaming)Model Size=~128M params, Training Data=120k hours of norm data, Inference Mode=Streaming, Latency=0.24s2026.04 | 10.01 | — | — | — | — | — | — | — | — | |
| Unified DM + MCR-RNNTModel Size=~128M params, Training Data=120k hours of norm data, Inference Mode=Streaming, Latency=0.16s2026.04 | 10.51 | — | — | — | — | — | — | — | — | |
| Mamba2 + DCConv (Streaming)Model Size=~128M params, Training Data=120k hours of norm data, Inference Mode=Streaming, Latency=0.16s2026.04 | 10.52 | — | — | — | — | — | — | — | — | |
| Nemotron-Speech-Streaming-En-0.6bModel Size=~600M params, Training Data=240k hours of PC data, Inference Mode=Streaming, Latency=0.40s2026.04 | 10.91 | — | — | — | — | — | — | — | — | |
| Unified single-mode (SM)Model Size=~128M params, Training Data=120k hours of norm data, Inference Mode=Streaming, Latency=0.32s2026.04 | 10.96 | — | — | — | — | — | — | — | — | |
| Baseline (Streaming)Model Size=~128M params, Training Data=120k hours of norm data, Inference Mode=Streaming, Latency=0.40s2026.04 | 11.47 | — | — | — | — | — | — | — | — | |
| Unified dual-mode (DM)Model Size=~128M params, Training Data=120k hours of norm data, Inference Mode=Streaming, Latency=0.32s2026.04 | 12.48 | — | — | — | — | — | — | — | — | |
| Unified DM + MCR-RNNT 0.6B (larger right cont.)Model Size=~600M params, Training Data=240k hours of PC data, Inference Mode=Streaming, Latency=0.16s2026.04 | 12.73 | — | — | — | — | — | — | — | — | |
| Unified single-mode (SM)Model Size=~128M params, Training Data=120k hours of norm data, Inference Mode=Streaming, Latency=0.24s2026.04 | 13.33 | — | — | — | — | — | — | — | — | |
| Baseline (Offline)Model Size=~128M params, Training Data=120k hours of norm data, Inference Mode=Streaming, Latency=0.56s2026.04 | 13.56 | — | — | — | — | — | — | — | — | |
| Unified dual-mode (DM)Model Size=~128M params, Training Data=120k hours of norm data, Inference Mode=Streaming, Latency=0.24s2026.04 | 16.91 | — | — | — | — | — | — | — | — | |
| Unified single-mode (SM)Model Size=~128M params, Training Data=120k hours of norm data, Inference Mode=Streaming, Latency=0.16s2026.04 | 17.16 | — | — | — | — | — | — | — | — | |
| Unified dual-mode (DM)Model Size=~128M params, Training Data=120k hours of norm data, Inference Mode=Streaming, Latency=0.16s2026.04 | 22.45 | — | — | — | — | — | — | — | — | |
| Parakeet-TDT-0.6b-v2Model Size=~600M params, Training Data=240k hours of PC data, Inference Mode=Streaming, Latency=1.12s2026.04 | 22.83 | — | — | — | — | — | — | — | — | |
| Baseline (Offline)Model Size=~128M params, Training Data=120k hours of norm data, Inference Mode=Streaming, Latency=0.40s2026.04 | 26.51 | — | — | — | — | — | — | — | — | |
| Baseline (Offline)Model Size=~128M params, Training Data=120k hours of norm data, Inference Mode=Streaming, Latency=0.32s2026.04 | 49.46 | — | — | — | — | — | — | — | — | |
| Parakeet-TDT-0.6b-v2Model Size=~600M params, Training Data=240k hours of PC data, Inference Mode=Streaming, Latency=0.56s2026.04 | 69.55 | — | — | — | — | — | — | — | — | |
| Baseline (Offline)Model Size=~128M params, Training Data=120k hours of norm data, Inference Mode=Streaming, Latency=0.24s2026.04 | 78.67 | — | — | — | — | — | — | — | — | |
| Baseline (Offline)Model Size=~128M params, Training Data=120k hours of norm data, Inference Mode=Streaming, Latency=0.16s2026.04 | 94.05 | — | — | — | — | — | — | — | — | |
| Parakeet-TDT-0.6b-v2Model Size=~600M params, Training Data=240k hours of PC data, Inference Mode=Streaming, Latency=0.40s2026.04 | 95.12 | — | — | — | — | — | — | — | — | |
| Parakeet-TDT-0.6b-v2Model Size=~600M params, Training Data=240k hours of PC data, Inference Mode=Streaming, Latency=0.32s2026.04 | 97.32 | — | — | — | — | — | — | — | — | |
| Parakeet-TDT-0.6b-v2Model Size=~600M params, Training Data=240k hours of PC data, Inference Mode=Streaming, Latency=0.24s2026.04 | 99.1 | — | — | — | — | — | — | — | — | |
| Parakeet-TDT-0.6b-v2Model Size=~600M params, Training Data=240k hours of PC data, Inference Mode=Streaming, Latency=0.16s2026.04 | 99.47 | — | — | — | — | — | — | — | — |