Automatic Speech Recognition on SlideAVSR (test)
9.5WER (All)Qwen2.5-Omni-7B C-ASR
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Qwen2.5-Omni-7B C-ASRBackbone=Qwen2.5-Omni-7B, Prompt train method=C-ASR2026.06 | 9.5 | 16 | 30.8 | |
| Qwen2.5-Omni-7B ReasonBackbone=Qwen2.5-Omni-7B, Prompt train method=Reason (Chain-of-thought)2026.06 | 9.7 | 16.2 | 29.9 | |
| Qwen2.5-Omni-7B ASRBackbone=Qwen2.5-Omni-7B, Prompt train method=ASR2026.06 | 10 | 17.9 | 35.5 | |
| Ultravox-v0.5-8B C-ASRBackbone=Ultravox-v0.5-8B, Prompt train method=C-ASR2026.06 | 10.4 | 17.6 | 34.7 | |
| Ultravox-v0.5-8B ReasonBackbone=Ultravox-v0.5-8B, Prompt train method=Reason (Chain-of-thought)2026.06 | 10.6 | 17.1 | 32.4 | |
| Ultravox-v0.5-8B ASRBackbone=Ultravox-v0.5-8B, Prompt train method=ASR2026.06 | 10.9 | 20.2 | 41 | |
| Audio-Flamingo-3 ReasonBackbone=Audio-Flamingo-3, Prompt train method=Reason (Chain-of-thought)2026.06 | 11.2 | 18.5 | 34.9 | |
| Audio-Flamingo-3 (Zero-shot)Backbone=Audio-Flamingo-3, Prompt train method=None (non-finetuned)2026.06 | 11.4 | 22.4 | 43.3 | |
| Audio-Flamingo-3 C-ASRBackbone=Audio-Flamingo-3, Prompt train method=C-ASR2026.06 | 12 | 19.5 | 37 | |
| Qwen2-Audio-7B ReasonBackbone=Qwen2-Audio-7B, Prompt train method=Reason (Chain-of-thought)2026.06 | 12.5 | 20.6 | 37.4 | |
| Qwen2-Audio-7B C-ASRBackbone=Qwen2-Audio-7B, Prompt train method=C-ASR2026.06 | 12.6 | 21.1 | 37.9 | |
| Audio-Flamingo-3 ASRBackbone=Audio-Flamingo-3, Prompt train method=ASR2026.06 | 12.8 | 22.1 | 43.6 | |
| Qwen2-Audio-7B ASRBackbone=Qwen2-Audio-7B, Prompt train method=ASR2026.06 | 13.5 | 24.7 | 46.2 | |
| Qwen2-Audio-7B (Zero-shot)Backbone=Qwen2-Audio-7B, Prompt train method=None (non-finetuned)2026.06 | 16.8 | 29.4 | 53.7 | |
| Qwen2.5-Omni-7B (Zero-shot)Backbone=Qwen2.5-Omni-7B, Prompt train method=None (non-finetuned)2026.06 | 21.5 | 25.3 | 43.9 | |
| Ultravox-v0.5-8B (Zero-shot)Backbone=Ultravox-v0.5-8B, Prompt train method=None (non-finetuned)2026.06 | 36.5 | 27.8 | 49.1 |