Multi-speaker Automatic Speech Recognition on LibriCSS
9.88CP-WERTellWhisper
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| TellWhisperProcessing paradigm=multi-speaker ASR, Positional encoding=TS-RoPE2026.01 | 9.88 | 11.06 | — | — | |
| TellWhisper-DiarizenProcessing paradigm=multi-speaker ASR, Positional encoding=TS-RoPE2026.01 | 9.93 | 11.15 | — | — | |
| DicowProcessing paradigm=multi-speaker ASR, Positional encoding=absolute2026.01 | 10.62 | 11.33 | — | — | |
| SortFormerProcessing paradigm=multi-speaker ASR, Positional encoding=absolute2026.01 | 12.16 | 12.88 | — | — | |
| Whisper-DProcessing paradigm=multi-speaker ASR, Positional encoding=absolute2026.01 | 12.41 | 12.58 | — | — | |
| Hyper-SD+WhisperProcessing paradigm=speaker diarization + single-speaker ASR (results alignment), Positional encoding=absolute2026.01 | 42.51 | 42.68 | — | — | |
| Pyannote3+WhisperProcessing paradigm=speaker diarization + single-speaker ASR (results alignment), Positional encoding=absolute2026.01 | 44.34 | 44.74 | — | — | |
| DicowPositional Encoding=absolute2026.01 | — | — | 9.43 | 11.05 | |
| SortFormerPositional Encoding=absolute2026.01 | — | — | 11.73 | 12.42 | |
| TellWhisper (ours)Positional Encoding=TS-RoPE2026.01 | — | — | 9.14 | 10.42 | |
| TellWhisper-DiarizenPositional Encoding=TS-RoPE2026.01 | — | — | 9.16 | 10.47 | |
| Whisper-DPositional Encoding=absolute2026.01 | — | — | 11.96 | 12.25 |