Inference Efficiency Evaluation on QA Evaluation Suite Inference
40Text Exit LayerGLM-4-Voice
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| GLM-4-VoiceBackbone=GLM-4-Voice, Text EE=-, Speech EE=-2026.03 | 40 | 40 | — | |
| GLM-4-VoiceBackbone=GLM-4-Voice, Text EE=-, Speech EE=Fixed (38)2026.03 | 40 | 38 | 5 | |
| GLM-4-VoiceBackbone=GLM-4-Voice, Text EE=-, Speech EE=Conf (36)2026.03 | 40 | 37.03 | 7.4 | |
| SPAR-KBackbone=GLM-4-Voice, Text EE=-, Speech EE=Even (36)2026.03 | 40 | 38 | 5 | |
| SPAR-KBackbone=GLM-4-Voice, Text EE=-, Speech EE=Odd (36)2026.03 | 40 | 38 | 5 | |
| SPAR-KBackbone=GLM-4-Voice, Text EE=-, Speech EE=Triple (37)2026.03 | 40 | 38 | 5 | |
| SPAR-KBackbone=GLM-4-Voice, Text EE=-, Speech EE=Even (33)2026.03 | 40 | 36.5 | 8.8 | |
| SPAR-KBackbone=GLM-4-Voice, Text EE=-, Speech EE=Even (35)2026.03 | 40 | 37 | 7.5 | |
| SPAR-KBackbone=GLM-4-Voice, Text EE=Conf (36), Speech EE=Even(36)2026.03 | 38.02 | 38 | 5 | |
| SPAR-KBackbone=GLM-4-Voice, Text EE=Even (36), Speech EE=-2026.03 | 38 | 40 | — | |
| Step-Audio-2Backbone=Step-Audio-2, Text EE=-, Speech EE=-2026.03 | 28 | 28 | — | |
| Step-Audio-2Backbone=Step-Audio-2, Text EE=-, Speech EE=Fixed (25)2026.03 | 28 | 25 | 11 | |
| Step-Audio-2Backbone=Step-Audio-2, Text EE=-, Speech EE=Conf (26)2026.03 | 28 | 26.07 | 6.9 | |
| SPAR-KBackbone=Step-Audio-2, Text EE=-, Speech EE=Even (22)2026.03 | 28 | 25 | 11 | |
| SPAR-KBackbone=Step-Audio-2, Text EE=-, Speech EE=Odd (22)2026.03 | 28 | 25 | 11 | |
| SPAR-KBackbone=Step-Audio-2, Text EE=-, Speech EE=Triple (22)2026.03 | 28 | 25 | 11 |