Speech Recognition on Common Voice EN
6.76WERStep-Audio2-Mini
Evaluation Results
| Method | Links | |
|---|---|---|
| Step-Audio2-Mini2025.12 | 6.76 | |
| Audio-FlamingoModel version=32025.12 | 7.4 | |
| Qwen-TTS-Tokenizer-25Hz (Stage 1)Codebook Size=32768, FPS=252026.01 | 7.51 | |
| Fun-Audio-ChatModel size=30B-A3B2025.12 | 7.79 | |
| Fun-Audio-ChatModel size=8B2025.12 | 8.88 | |
| Kimi-Audio2025.12 | 10.31 | |
| Qwen-TTS-Tokenizer-25Hz (Stage 2)Codebook Size=32768, FPS=252026.01 | 10.4 | |
| S3 Tokenizer(FSQ)Codebook Size=6561, FPS=252026.01 | 10.67 | |
| SymphonySource category=Corti, Real-time processing=true2026.05 | 11.2 | |
| ElevenLabsSource category=Closed-source, Real-time processing=true2026.05 | 11.3 | |
| S3 Tokenizer(VQ)Codebook Size=4096, FPS=252026.01 | 11.56 | |
| ParakeetSource category=Open-source, Real-time processing=true2026.05 | 11.7 | |
| S3 Tokenizer(VQ)Codebook Size=4096, FPS=502026.01 | 12.06 | |
| WhisperSource category=Open-source, Real-time processing=true2026.05 | 13.1 | |
| OpenAISource category=Closed-source, Real-time processing=true2026.05 | 13.3 | |
| MiMo-Audio2025.12 | 62.05 |