Speaker-centric Multimodal Understanding on HumanOmni-Speaker
1.22Speech Recognition (Easy)Qwen3-Omni-flash
Evaluation Results
| Method | Links | ||||||||
|---|---|---|---|---|---|---|---|---|---|
| Qwen3-Omni-flashModel Size=-2026.03 | 1.22 | 43.9 | 2.8 | 3.6 | 43.5 | 82.9 | 47.2 | 32.1 | |
| Gemini3-ProModel Size=-2026.03 | 1.39 | 5.2 | 12.8 | 5.5 | 30.5 | 36.6 | 36.3 | 18.3 | |
| Qwen2.5-OmniModel Size=7B2026.03 | 1.8 | 37.1 | 7.4 | 4 | 54.5 | 83.6 | 49.4 | 33.9 | |
| OLAModel Size=7B2026.03 | 1.9 | 51.1 | 20.6 | 12.4 | 63.2 | 95.4 | 56.85 | 43.06 | |
| HumanOmni-SpeakerModel Size=3B2026.03 | 1.9 | 13.2 | 0.8 | 1 | 21.1 | 47.1 | 28.5 | 16.2 | |
| Qwen2.5-Omni-SFTModel Size=3B2026.03 | 2 | 13.4 | 3 | 1.7 | 33.2 | 52.1 | 31.5 | 19.1 | |
| Qwen2.5-OmniModel Size=3B2026.03 | 2.2 | 44.2 | 7.4 | 6.6 | 51.5 | 84.6 | 50.9 | 35.3 | |
| VITA1.5Model Size=7B2026.03 | 3.4 | 51.4 | 20.2 | 10.3 | 56.6 | 93.6 | 54.4 | 41.4 |