Speaker-Attributed Automatic Speech Recognition on Alimeeting Far (test)
13.97CERSpeakerLM
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| SpeakerLMArchitecture=End-to-End Baselines, Training Data=7638.95h2026.04 | 13.97 | — | 16.05 | 2.08 | |
| SpeakerLMArchitecture=End-to-End Baselines, Training Data=212.25h2026.04 | 18.63 | — | 32.22 | 13.59 | |
| Speaker-Reasoner Multi-turnStage=22026.04 | 20.34 | 7.47 | 20.29 | -0.05 | |
| Speaker-Reasoner Multi-turn w/ SACStage=32026.04 | 20.57 | 7.34 | 20.43 | -0.14 | |
| Speaker-Reasoner BaseStage=12026.04 | 21.16 | 8.96 | 22.64 | 1.48 | |
| Qwen3-Omni + SOT sftArchitecture=End-to-End, Stage=Ablation baseline2026.04 | 24.24 | — | 26.03 | 1.79 | |
| Speaker-Reasoner Multi-turn 7BScale=7B2026.04 | 24.33 | 15.56 | 34.81 | 10.48 | |
| Speaker-Reasoner Base 7BScale=7B2026.04 | 24.97 | 18.43 | 38.12 | 13.15 | |
| Qwen3-Omni-30B-A3B-InstructArchitecture=End-to-End Baselines2026.04 | 25.4 | 37.15 | 36.28 | 10.88 | |
| Pyannote3.1 + ParaformerArchitecture=Cascade Baselines2026.04 | 30.15 | 19.13 | 45.39 | 15.24 | |
| Gemini-2.5-ProArchitecture=End-to-End Baselines, Access=Closed-source model2026.04 | 30.16 | 56.39 | 39.29 | 9.13 | |
| VibeVoice-ASRArchitecture=End-to-End Baselines2026.04 | 34.67 | 20.7 | 40.54 | 5.87 | |
| Qwen2.5-Omni-7BArchitecture=End-to-End Baselines2026.04 | 38.13 | 91.77 | 73.38 | 35.25 | |
| TagSpeech-AlimeetingArchitecture=End-to-End Baselines2026.04 | 47.11 | 52.46 | 68.74 | 21.63 |