Automatic Speech Recognition on Earnings 22
9.32WERQwen3-ASR-1.7B
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Qwen3-ASR-1.7BDecoding Architecture=AR, Params (B)=2.02025.08 | 9.32 | 20.12 | 5.62 | |
| Whisfusion + rerankDecoding Architecture=NAR, Params (B)=2.42025.08 | 9.64 | 143.27 | 6.07 | |
| Phi-4-multimodalArchitecture Type=AR, Params (B)=5.6, RTFx=4.85, Avg. WER=6.72026.02 | 10.2 | — | — | |
| WhisfusionDecoding Architecture=NAR, Params (B)=1.52025.08 | 10.33 | 173.45 | 6.55 | |
| FastWhisper-largeSize/h=1,634, Params/B=0.74, Evaluation Protocol=short-form2026.01 | 10.5 | — | — | |
| Whisper-large-v3Decoding Architecture=AR, Params (B)=1.62025.08 | 10.64 | 35.33 | 7.11 | |
| Voxtral-MiniArchitecture Type=AR, Params (B)=3.0, RTFx=12.19, Avg. WER=8.02026.02 | 10.7 | — | — | |
| MDM-ASRArchitecture Type=NAR, Params (B)=1.0, RTFx=46.81, Avg. WER=6.92026.02 | 10.7 | — | — | |
| Whisper-turboDecoding Architecture=AR, Params (B)=0.82025.08 | 10.88 | 143.99 | 8.86 | |
| Whisper-large-v3Architecture Type=AR, Params (B)=1.5, RTFx=12.83, Avg. WER=8.52026.02 | 11.3 | — | — | |
| Canary-1b-v2Decoding Architecture=AR, Params (B)=1.02025.08 | 11.36 | 47.87 | 6.4 | |
| Whisper-large-v3Size/h=680,000, Params/B=1.50, Evaluation Protocol=short-form2026.01 | 11.4 | — | — | |
| Whisper-large-v3-turbo# Total Params=1.5B2025.11 | 11.63 | — | — | |
| distil-Whisper-large-v3Size/h=22,000, Params/B=0.75, Evaluation Protocol=short-form2026.01 | 11.8 | — | — | |
| CanarySize/h=31,200, Params/B=1.00, Evaluation Protocol=short-form2026.01 | 12.2 | — | — | |
| OWSM-CTC v3.1Decoding Architecture=NAR, Params (B)=1.02025.08 | 12.71 | 665.74 | 8.27 | |
| Canary-1b-flashArchitecture Type=AR, Params (B)=1.0, RTFx=29.25, Avg. WER=7.22026.02 | 12.8 | — | — | |
| CrisperWhisperSize/h=10,000, Params/B=1.50, Evaluation Protocol=short-form2026.01 | 12.9 | — | — | |
| Parakeet-CTCArchitecture Type=NAR, Params (B)=1.1, RTFx=120.20, Avg. WER=8.32026.02 | 13.8 | — | — | |
| Drax (MBR, 8/16)Decoding Architecture=NAR, Params (B)=1.22025.08 | 14.09 | 33.16 | 8.34 | |
| Qwen2-AudioArchitecture Type=AR, Params (B)=8.4, RTFx=4.18, Avg. WER=8.32026.02 | 14.1 | — | — | |
| Qwen2.5-Omni-3B# Total Params=5B2025.11 | 14.81 | — | — | |
| DraxArchitecture Type=NAR, Params (B)=1.2, RTFx=11.32, Avg. WER=9.22026.02 | 15.2 | — | — | |
| OWSM-v3.1Architecture Type=AR, Params (B)=1.0, RTFx=15.52, Avg. WER=10.32026.02 | 15.4 | — | — | |
| Whisper-LLaDADecoding Architecture=NAR, Params (B)=8.72025.08 | 16.11 | 7.92 | 9.82 | |
| Whisper-CDModel=Large-v3-Turbo2026.03 | 16.16 | — | — | |
| OWSM-CTCArchitecture Type=NAR, Params (B)=1.0, RTFx=132.54, Avg. WER=11.42026.02 | 17.2 | — | — | |
| LFM2-Audio-1.5B# Total Params=1.5B2025.11 | 19.75 | — | — | |
| MMS-allDecoding Architecture=NAR, Params (B)=1.02025.08 | 22.78 | 681.21 | 12.93 | |
| Whisper BaselineModel=Large-v3-Turbo2026.03 | 33.25 | — | — | |
| ChunkFormercontext size [latt, c, r]=[128, 64, 128]2025.02 | 48.56 | — | — | |
| ChunkFormercontext size [latt, c, r]=[256, 128, 128]2025.02 | 48.67 | — | — | |
| ChunkFormercontext size [latt, c, r]=[128, 256, 128]2025.02 | 48.68 | — | — | |
| Efficient Conformerdecoding_mode=full-context2025.02 | 52.53 | — | — | |
| Squeezeformerdecoding_mode=full-context2025.02 | 53.44 | — | — | |
| ChunkFormerdecoding_mode=full-context2025.02 | 54.55 | — | — | |
| Conformerdecoding_mode=full-context2025.02 | 54.91 | — | — | |
| Whisper-CDModel=Large-v32026.03 | 57.08 | — | — | |
| Whisper BaselineModel=Large-v32026.03 | 520.94 | — | — |