Multi-speaker Automatic Speech Recognition on AMI
24.62CP-WERParakeet
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| ParakeetInference mode=non-streaming2026.03 | 24.62 | — | — | — | — | |
| G-STARInference mode=non-streaming2026.03 | 24.86 | — | — | — | 19 | |
| MOSS-DiarizenInference mode=non-streaming2026.03 | 25.13 | — | — | — | 32.2 | |
| Vibevoice-ASRInference mode=non-streaming2026.03 | 30.51 | — | — | — | 31.99 | |
| TellWhisperProcessing paradigm=multi-speaker ASR, Positional encoding=TS-RoPE2026.01 | 32.53 | 33.47 | — | — | — | |
| TellWhisper-DiarizenProcessing paradigm=multi-speaker ASR, Positional encoding=TS-RoPE2026.01 | 33.12 | 33.72 | — | — | — | |
| DicowProcessing paradigm=multi-speaker ASR, Positional encoding=absolute2026.01 | 33.57 | 34.02 | — | — | — | |
| SortFormerProcessing paradigm=multi-speaker ASR, Positional encoding=absolute2026.01 | 34.24 | 35.96 | — | — | — | |
| Whisper-DProcessing paradigm=multi-speaker ASR, Positional encoding=absolute2026.01 | 35.23 | 36.86 | — | — | — | |
| Hyper-SD+WhisperProcessing paradigm=speaker diarization + single-speaker ASR (results alignment), Positional encoding=absolute2026.01 | 58.51 | 59.62 | — | — | — | |
| Pyannote3+WhisperProcessing paradigm=speaker diarization + single-speaker ASR (results alignment), Positional encoding=absolute2026.01 | 59.58 | 61.21 | — | — | — | |
| DicowPositional Encoding=absolute2026.01 | — | — | 32.83 | 33.53 | — | |
| SortformerInference mode=non-streaming2026.03 | — | — | — | — | 29.87 | |
| SortFormerPositional Encoding=absolute2026.01 | — | — | 33.11 | 34.57 | — | |
| TellWhisper (ours)Positional Encoding=TS-RoPE2026.01 | — | — | 30.72 | 31.87 | — | |
| TellWhisper-DiarizenPositional Encoding=TS-RoPE2026.01 | — | — | 31.35 | 32.11 | — | |
| Whisper-DPositional Encoding=absolute2026.01 | — | — | 34.16 | 35.81 | — |