Automatic Speech Recognition (En) on OpenASR (test)
6.14WERPhi4-MM
Evaluation Results
| Method | Links | |
|---|---|---|
| Phi4-MMModel Size=5.8B, #speech tokens/30 Sec.=3752026.01 | 6.14 | |
| FastSLMModel Size=4.8B, #speech tokens/30 Sec.=502026.01 | 6.47 | |
| Voxtral-miniModel Size=4.7B, #speech tokens/30 Sec.=7502026.01 | 7.05 | |
| Qwen2-AudioModel Size=8B, #speech tokens/30 Sec.=1012026.01 | 7.43 | |
| WhisperModel Size=1.5B, #speech tokens/30 Sec.=15002026.01 | 7.44 | |
| Gemini-2.5-Flash#speech tokens/30 Sec.=9602026.01 | 9.29 |