Multi-speaker Transcription on AMI-SDM English
13.43DERVIBEVOICE-ASR
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| VIBEVOICE-ASRInference Protocol=Single-pass2026.01 | 13.43 | 28.82 | 29.8 | 24.65 | |
| Gemini-2.5-ProInference Protocol=Chunk-wise, Chunk Duration=240s2026.01 | 23.79 | 34.78 | 41.39 | 22.35 | |
| Gemini-3-ProInference Protocol=Chunk-wise, Chunk Duration=240s2026.01 | 43.04 | 26.91 | 64.86 | 22.09 |