Multi-speaker Automatic Speech Recognition on NotSoFar
34.48CP-WERTellWhisper
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| TellWhisperProcessing paradigm=multi-speaker ASR, Positional encoding=TS-RoPE2026.01 | 34.48 | 34.51 | — | — | |
| TellWhisper-DiarizenProcessing paradigm=multi-speaker ASR, Positional encoding=TS-RoPE2026.01 | 34.81 | 34.86 | — | — | |
| DicowProcessing paradigm=multi-speaker ASR, Positional encoding=absolute2026.01 | 35.22 | 35.64 | — | — | |
| SortFormerProcessing paradigm=multi-speaker ASR, Positional encoding=absolute2026.01 | 36.54 | 36.73 | — | — | |
| Whisper-DProcessing paradigm=multi-speaker ASR, Positional encoding=absolute2026.01 | 38.04 | 38.15 | — | — | |
| Hyper-SD+WhisperProcessing paradigm=speaker diarization + single-speaker ASR (results alignment), Positional encoding=absolute2026.01 | 67.22 | 67.84 | — | — | |
| Pyannote3+WhisperProcessing paradigm=speaker diarization + single-speaker ASR (results alignment), Positional encoding=absolute2026.01 | 69.85 | 70.89 | — | — | |
| DicowPositional Encoding=absolute2026.01 | — | — | 32.2 | 32.43 | |
| SortFormerPositional Encoding=absolute2026.01 | — | — | 34.52 | 35.21 | |
| TellWhisper (ours)Positional Encoding=TS-RoPE2026.01 | — | — | 32.31 | 32.36 | |
| TellWhisper-DiarizenPositional Encoding=TS-RoPE2026.01 | — | — | 32.52 | 32.45 | |
| Whisper-DPositional Encoding=absolute2026.01 | — | — | 35.67 | 34.24 |