Multi-speaker Automatic Speech Recognition on Libri2Mix
14.34CP-WERDicow
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| DicowProcessing paradigm=multi-speaker ASR, Positional encoding=absolute2026.01 | 14.34 | 14.35 | — | — | |
| TellWhisperProcessing paradigm=multi-speaker ASR, Positional encoding=TS-RoPE2026.01 | 14.39 | 14.61 | — | — | |
| TellWhisper-DiarizenProcessing paradigm=multi-speaker ASR, Positional encoding=TS-RoPE2026.01 | 14.45 | 14.87 | — | — | |
| Whisper-DProcessing paradigm=multi-speaker ASR, Positional encoding=absolute2026.01 | 14.48 | 14.57 | — | — | |
| SortFormerProcessing paradigm=multi-speaker ASR, Positional encoding=absolute2026.01 | 14.62 | 14.76 | — | — | |
| Tiger+WhisperProcessing paradigm=speech decoupling -> single-speaker ASR, Positional encoding=absolute2026.01 | 37.96 | 37.97 | — | — | |
| Hyper-SD+WhisperProcessing paradigm=speaker diarization + single-speaker ASR (results alignment), Positional encoding=absolute2026.01 | 61.23 | 61.25 | — | — | |
| Pyannote3+WhisperProcessing paradigm=speaker diarization + single-speaker ASR (results alignment), Positional encoding=absolute2026.01 | 62.05 | 62.08 | — | — | |
| DicowPositional Encoding=absolute2026.01 | — | — | 13.34 | 13.36 | |
| SortFormerPositional Encoding=absolute2026.01 | — | — | 14.51 | 14.55 | |
| TellWhisper (ours)Positional Encoding=TS-RoPE2026.01 | — | — | 13.32 | 13.67 | |
| TellWhisper-DiarizenPositional Encoding=TS-RoPE2026.01 | — | — | 13.46 | 13.83 | |
| Whisper-DPositional Encoding=absolute2026.01 | — | — | 14.39 | 14.4 |