Speech Recognition on VoxPopuli En
5.4WERAF-Next-Instruct
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| AF-Next-Instruct2026.04 | 5.4 | — | — | |
| Audio Flamingo 32026.04 | 5.6 | — | — | |
| Phi-4-mm2026.04 | 5.9 | — | — | |
| ECLMCorrection model size=0.5B, Decoding strategy=greedy, Base model=Parakeet-TDT-v22024.05 | 6.4 | — | 1 | |
| Parakeet-TDT-v2Correction method=None2024.05 | 6.5 | — | — | |
| WhisperBackbone=Large V2, Evaluation Protocol=Zero-shot2022.12 | 7.3 | 59.2 | — | |
| wav2vec 2.0Backbone=Large, Language Model=None2022.12 | 17.9 | — | — |