Automatic Speech Recognition on AISHELL (test)
1.13CERQwen2.5-Omni
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Qwen2.5-Omni#Param=7B2026.05 | 1.13 | — | |
| VITA-Audio#Param=7B2026.05 | 1.51 | — | |
| VITA-QINYU-8B#Param=8B2026.05 | 1.64 | — | |
| Paraformer-large#Parameters=220M, AR/NAR=NAR, LM=w/o, batchsize=12023.05 | 1.95 | 0.0251 | |
| VITA-QINYU-4B#Param=4B2026.05 | 2.35 | — | |
| GLM-4-Voice#Param=9B2026.05 | 2.46 | — | |
| Freeze-Omni#Param=7B2026.05 | 2.48 | — | |
| U2Experiment=EXP2, Decoding chunk size=full2020.12 | 3.7 | — | |
| Full attention conformerExperiment=EXP1, Decoding chunk size=full2020.12 | 3.96 | — | |
| WeNet Conformer-U2++#Parameters=47.30M, AR/NAR=AR, LM=w/, batchsize=12023.05 | 4.4 | — | |
| U2Experiment=EXP2, Decoding chunk size=162020.12 | 4.41 | — | |
| ESPnet Conformer#Parameters=46.25M, AR/NAR=AR, LM=w/, batchsize=12023.05 | 4.6 | — | |
| Conformer#Parameters=46.25M, AR/NAR=AR, LM=w/, batchsize=12023.05 | 4.65 | 1.43 | |
| Paraformer#Parameters=46.3M, AR/NAR=NAR, LM=w/o, batchsize=12023.05 | 4.95 | 0.0168 | |
| K2 Transducer#Parameters=80M, AR/NAR=AR, LM=w/o, batchsize=12023.05 | 5.05 | — | |
| Conformer#Parameters=46.25M, AR/NAR=AR, LM=w/o, batchsize=12023.05 | 5.21 | 0.21 | |
| CATUnit=mono-phone, LM=3-gram2020.05 | 6.34 | — | |
| PaddleSpeech DeepSpeech2#Parameters=58.4M, AR/NAR=NAR, LM=w/, batchsize=12023.05 | 6.4 | — | |
| CTC/attentionUnit=Chinese char, LM=RNN2020.05 | 6.7 | — | |
| ESPnet Transformertoken=char2019.09 | 6.7 | — | |
| Kaldi (s5)token=char2019.09 | 7.4 | — | |
| LF-MMI with i-vectorUnit=tri-phone, LM=3-gram2020.05 | 7.43 | — | |
| ESPnetUnit=Chinese char, LM=RNN2020.05 | 8 | — | |
| ESPnet RNNtoken=char2019.09 | 8 | — | |
| AttentionUnit=Chinese char, LM=RNN, Reference=[37]2020.05 | 8.71 | — | |
| AttentionUnit=Chinese char, LM=RNN, Reference=[36]2020.05 | 18.7 | — |