Automatic Speech Recognition on AMI (test)
10.8Word Error RateFull FT
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| Full FTParams=764M, Backbone=Whisper-Medium2026.06 | 10.8 | — | — | — | |
| Speech-HandsFramework=Qwen2.5-Omni, External Reference=Parakeet-tdt-0.6b-v32026.01 | 11.2 | — | — | — | |
| GC-LoRAWhisper model size=medium2026.06 | 11.5 | — | — | — | |
| GC-LoRAParams=447k, Backbone=Whisper-Medium2026.06 | 11.5 | — | — | — | |
| Phi-4-MMModel Type=Omni-LLM2026.01 | 11.69 | — | — | — | |
| LoRAWhisper model size=medium2026.06 | 11.7 | — | — | — | |
| LoRAParams=829k, Backbone=Whisper-Medium2026.06 | 11.7 | — | — | — | |
| GC-LoRAWhisper model size=large-v32026.06 | 12.2 | — | — | — | |
| LoRAWhisper model size=large-v32026.06 | 12.4 | — | — | — | |
| Parakeet-tdt-0.6b-v3Model Type=ASR model2026.01 | 12.69 | — | — | — | |
| GC-LoRAWhisper model size=small2026.06 | 13.4 | — | — | — | |
| LoRAWhisper model size=small2026.06 | 14.5 | — | — | — | |
| Speech-HandsFramework=Qwen2.5-Omni, External Reference=Whisper-v2-large2026.01 | 15.03 | — | — | — | |
| Speech-HandsFramework=Qwen2.5-Omni, External Reference=Canary-1b-v22026.01 | 15.29 | — | — | — | |
| FC-XXLDecoder=CTC, Train Dataset=ASR Set ++2023.05 | 15.62 | — | — | — | |
| FC-XLDecoder=CTC, Train Dataset=ASR Set ++2023.05 | 16.3 | — | — | — | |
| Zero-shotParams=0, Backbone=Whisper-Medium2026.06 | 16.4 | — | — | — | |
| Whisper-v2-largeModel Type=ASR model2026.01 | 16.88 | — | — | — | |
| FC-XXLDecoder=RNNT, Train Dataset=ASR Set ++2023.05 | 17.1 | — | — | — | |
| FC-XLDecoder=RNNT, Train Dataset=ASR Set ++2023.05 | 17.55 | — | — | — | |
| FC-XXLDecoder=CTC, Train Dataset=ASR Set2023.05 | 17.62 | — | — | — | |
| GC-LoRAWhisper model size=base2026.06 | 17.8 | — | — | — | |
| Zipformer (IHM)Setting=IHM, Backbone=Zipformer2022.12 | 18.04 | 2.22 | 4.51 | 11.31 | |
| FC-XLDecoder=RNNT, Train Dataset=ASR Set2023.05 | 18.28 | — | — | — | |
| FC-XLDecoder=CTC, Train Dataset=ASR Set2023.05 | 18.41 | — | — | — | |
| FC-XXLDecoder=RNNT, Train Dataset=ASR Set2023.05 | 18.81 | — | — | — | |
| LoRAWhisper model size=base2026.06 | 19.3 | — | — | — | |
| Qwen2.5_omniModel Type=Omni-LLM2026.01 | 19.77 | — | — | — | |
| Canary-1b-v2Model Type=ASR model2026.01 | 19.8 | — | — | — | |
| Gemini-2-FlashModel Type=Omni-LLM2026.01 | 21.58 | — | — | — | |
| GPU-accelerated GSSSetting=GSS, Backbone=Zipformer, Channels=82022.12 | 22.83 | 2.43 | 6.07 | 14.33 | |
| GER (Cascaded)Framework=Qwen2.5-Omni, External Reference=Parakeet-tdt-0.6b-v32026.01 | 22.91 | — | — | — | |
| GER (Cascaded)Framework=Qwen2.5-Omni, External Reference=Whisper-v2-large2026.01 | 23.44 | — | — | — | |
| GER (Cascaded)Framework=Qwen2.5-Omni, External Reference=Canary-1b-v22026.01 | 24.58 | — | — | — | |
| GC-LoRAWhisper model size=tiny2026.06 | 24.6 | — | — | — | |
| LoRAWhisper model size=tiny2026.06 | 27.6 | — | — | — | |
| Zipformer (SDM)Setting=SDM, Backbone=Zipformer2022.12 | 32.1 | 4.01 | 9.59 | 18.5 | |
| GPT-4o-voiceModel Type=Omni-LLM2026.01 | 57.76 | — | — | — |