Automatic Speech Recognition on SlideSpeech (test)
7.2WER (All)Qwen2.5-Omni-7B Reason
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Qwen2.5-Omni-7B ReasonBackbone=Qwen2.5-Omni-7B, Prompt train method=Reason (Chain-of-thought)2026.06 | 7.2 | 11.2 | 22.5 | |
| Qwen2.5-Omni-7B C-ASRBackbone=Qwen2.5-Omni-7B, Prompt train method=C-ASR2026.06 | 7.3 | 11.3 | 23 | |
| Ultravox-v0.5-8B ReasonBackbone=Ultravox-v0.5-8B, Prompt train method=Reason (Chain-of-thought)2026.06 | 7.3 | 11.4 | 23 | |
| Qwen2.5-Omni-7B ASRBackbone=Qwen2.5-Omni-7B, Prompt train method=ASR2026.06 | 7.4 | 12.4 | 25.4 | |
| Qwen2-Audio-7B ReasonBackbone=Qwen2-Audio-7B, Prompt train method=Reason (Chain-of-thought)2026.06 | 7.7 | 12.6 | 24.6 | |
| Audio-Flamingo-3 ReasonBackbone=Audio-Flamingo-3, Prompt train method=Reason (Chain-of-thought)2026.06 | 7.7 | 11.8 | 23 | |
| Ultravox-v0.5-8B C-ASRBackbone=Ultravox-v0.5-8B, Prompt train method=C-ASR2026.06 | 7.7 | 11.8 | 23.6 | |
| Qwen2-Audio-7B ASRBackbone=Qwen2-Audio-7B, Prompt train method=ASR2026.06 | 7.8 | 14.7 | 27.5 | |
| Qwen2-Audio-7B C-ASRBackbone=Qwen2-Audio-7B, Prompt train method=C-ASR2026.06 | 8 | 13 | 25.1 | |
| Audio-Flamingo-3 C-ASRBackbone=Audio-Flamingo-3, Prompt train method=C-ASR2026.06 | 8 | 11.8 | 24 | |
| Ultravox-v0.5-8B ASRBackbone=Ultravox-v0.5-8B, Prompt train method=ASR2026.06 | 8.1 | 13.1 | 26.6 | |
| Audio-Flamingo-3 (Zero-shot)Backbone=Audio-Flamingo-3, Prompt train method=None (non-finetuned)2026.06 | 8.2 | 12 | 24.3 | |
| Audio-Flamingo-3 ASRBackbone=Audio-Flamingo-3, Prompt train method=ASR2026.06 | 8.5 | 13.1 | 26.6 | |
| Qwen2-Audio-7B (Zero-shot)Backbone=Qwen2-Audio-7B, Prompt train method=None (non-finetuned)2026.06 | 10.5 | 17.1 | 30.2 | |
| Qwen2.5-Omni-7B (Zero-shot)Backbone=Qwen2.5-Omni-7B, Prompt train method=None (non-finetuned)2026.06 | 14.6 | 14.5 | 28.8 | |
| Ultravox-v0.5-8B (Zero-shot)Backbone=Ultravox-v0.5-8B, Prompt train method=None (non-finetuned)2026.06 | 29.2 | 16.6 | 30.2 |