Speech Recognition on Fleurs En
2.4WERGPT-4o-Transcribe
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| GPT-4o-Transcribe2026.01 | 2.4 | — | |
| Qwen3-Omni-Instruct2026.02 | 2.72 | — | |
| Qwen3 Omni2025.10 | 2.72 | — | |
| Gemini-2.5-Pro2026.01 | 2.94 | — | |
| Ming-Flash-Omni2025.10 | 2.99 | — | |
| Qwen-TTS-Tokenizer-25Hz (Stage 1)Codebook Size=32768, FPS=252026.01 | 3.07 | — | |
| ERNIE 5.02026.02 | 3.14 | — | |
| GPT-4o-Audio2026.02 | 3.32 | — | |
| Qwen3-ASR-1.7BParameters=1.7B2026.01 | 3.35 | — | |
| Gemini-3-Pro2026.02 | 3.63 | — | |
| Whisper-large-v32026.01 | 4.08 | — | |
| Qwen-TTS-Tokenizer-25Hz (Stage 2)Codebook Size=32768, FPS=252026.01 | 4.14 | — | |
| ERNIE 5.0-Base2026.02 | 4.39 | — | |
| Qwen3-ASR-0.6BParameters=0.6B2026.01 | 4.39 | — | |
| WhisperBackbone=Large V2, Evaluation Protocol=Zero-shot2022.12 | 4.4 | 69.9 | |
| Kimi Audio2026.02 | 4.44 | — | |
| Kimi Audio2025.10 | 4.44 | — | |
| LongCat-Flash-Omni2026.02 | 5.02 | — | |
| FunASR-MLT-Nano2026.01 | 5.49 | — | |
| Doubao-ASR2026.01 | 6.31 | — | |
| S3 Tokenizer(FSQ)Codebook Size=6561, FPS=252026.01 | 6.58 | — | |
| Qwen2 Audio2025.10 | 6.9 | — | |
| S3 Tokenizer(VQ)Codebook Size=4096, FPS=252026.01 | 7.65 | — | |
| wav2vec 2.0Backbone=Large, Language Model=None2022.12 | 14.6 | — |