Automatic Speech Recognition on Global Benchmark Suite
5.12Average CER/WEROurs
Evaluation Results
| Method | Links | |
|---|---|---|
| OursModel Size=2.3B2026.04 | 5.12 | |
| Qwen3-ASR-1.7BModel Size=2.0B (↓)2026.04 | 5.45 | |
| Step-Audio2-miniModel Size=8B+ (↑)2026.04 | 6.19 | |
| Qwen3-Omni-InstModel Size=30B-A3B (↑)2026.04 | 6.24 | |
| Fun-ASR-nanoModel Size=0.8B (↓)2026.04 | 6.28 | |
| FireRedASR-LLMModel Size=8B+ (↑)2026.04 | 6.46 | |
| GLM-ASR-nanoModel Size=1.5B (↓)2026.04 | 8.71 | |
| embedding-based H-SoftmaxEmbedding Source=XLM-base, Clustering Method=2-medoids, Distance Metric=Standardized Euclidean2025.01 | 9.3 | |
| embedding-based H-SoftmaxEmbedding Source=LABSE, Clustering Method=Median, Distance Metric=Euclidean2025.01 | 9.3 | |
| embedding-based H-SoftmaxEmbedding Source=XLM-large, Clustering Method=2-medoids, Distance Metric=Standardized Euclidean2025.01 | 9.4 | |
| Huffman H-SoftmaxOutput Strategy=H-Softmax, Clustering=Huffman2025.01 | 9.5 | |
| embedding-based H-SoftmaxEmbedding Source=Mono-Map, Clustering Method=Average, Distance Metric=City Block2025.01 | 9.5 | |
| embedding-based H-SoftmaxEmbedding Source=XLM-XL, Clustering Method=Weighted, Distance Metric=Correlation2025.01 | 9.6 | |
| SoftmaxOutput Strategy=Softmax2025.01 | 11.1 |