Word alignment on Buckeye
21.75Mean Boundary ErrorMFA ARPA 3.0
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| MFA ARPA 3.0Category=MFA 3.0 pretrained2026.06 | 21.75 | 48.76 | 70.16 | 91.35 | 97.29 | |
| MFA Global 3.0Category=MFA 3.0 pretrained2026.06 | 25.35 | 47.27 | 67.77 | 89.3 | 95.51 | |
| MFA ARPA 1.0Category=Baseline aligners2026.06 | 27.22 | 39.3 | 61.99 | 87.91 | 95.65 | |
| CharsiuCategory=Baseline aligners, neural aligner=true2026.06 | 29.24 | 36.46 | 60.03 | 87.4 | 95.47 | |
| MFAModel Type=GM-HMM, Align method=Likelihood2026.07 | 32 | — | — | 90 | — | |
| MAUSCategory=Baseline aligners2026.06 | 32.78 | 42.5 | 62.15 | 83.77 | 93.44 | |
| SPPASCategory=Baseline aligners2026.06 | 38.63 | 33.6 | 56.54 | 81.79 | 91.36 | |
| Whisper-large-v3Model Type=AED, Align method=Gradients*, Note=optimal encoder depth 3/42026.07 | 39 | — | — | 80 | — | |
| XLS-R (Phoneme)Model Type=CTC, Align method=Posteriors2026.07 | 44 | — | — | 70.4 | — | |
| MMS-FAModel Type=CTC, Align method=Posteriors2026.07 | 46 | — | — | 69.9 | — | |
| CrisperWhisperModel Type=AED, Align method=Cross-att.2026.07 | 47 | — | — | 80.1 | — | |
| Whisper-large-v3Model Type=AED, Align method=Cross-att.2026.07 | 49 | — | — | 69.1 | — | |
| MMSCategory=ASR aligners, neural aligner=true2026.06 | 49.54 | 9.58 | 20.27 | 61.85 | 92.05 | |
| OWLS-1BModel Type=AED, Align method=Cross-att.2026.07 | 51 | — | — | 69.1 | — | |
| VoxtralModel Type=Speech LLM, Align method=Self-att.2026.07 | 52 | — | — | 65.5 | — | |
| Whisper-large-v3Model Type=AED, Align method=Gradients2026.07 | 53 | — | — | 66.2 | — | |
| MAPSCategory=Baseline aligners, neural aligner=true2026.06 | 54.44 | 38.24 | 55.07 | 71.96 | 79.06 | |
| CrisperWhisperModel Type=AED, Align method=Gradients2026.07 | 59 | — | — | 59.2 | — | |
| BFACategory=Baseline aligners, neural aligner=true2026.06 | 61.54 | 10.93 | 21.06 | 48.03 | 84.82 | |
| Whisper-baseModel Type=AED, Align method=Cross-att.2026.07 | 62 | — | — | 66.3 | — | |
| VoxtralModel Type=Speech LLM, Align method=Gradients2026.07 | 74 | — | — | 51 | — | |
| Whisper-baseModel Type=AED, Align method=Gradients2026.07 | 75 | — | — | 52.7 | — | |
| Phi-4-MMModel Type=Speech LLM, Align method=Self-att.2026.07 | 79 | — | — | 39.8 | — | |
| XLS-R (Phoneme)Model Type=CTC, Align method=Gradients2026.07 | 81 | — | — | 66.4 | — | |
| NeMoCategory=ASR aligners, neural aligner=true2026.06 | 88.62 | 7 | 13.31 | 35.81 | 63.09 | |
| Parakeet TDTModel Type=Transd., Align method=Posteriors2026.07 | 90 | — | — | 38.6 | — | |
| Parakeet RNN-TModel Type=Transd., Align method=Posteriors2026.07 | 93 | — | — | 35.4 | — | |
| Parakeet CTCModel Type=CTC, Align method=Posteriors2026.07 | 99 | — | — | 32.2 | — | |
| Canary-QwenModel Type=Speech LLM, Align method=Gradients2026.07 | 99 | — | — | 40.6 | — | |
| Phi-4-MMModel Type=Speech LLM, Align method=Gradients2026.07 | 104 | — | — | 43.1 | — | |
| OWSM-CTCModel Type=CTC, Align method=Posteriors2026.07 | 110 | — | — | 25.2 | — | |
| WhisperXCategory=ASR aligners, neural aligner=true2026.06 | 110.9 | 1.31 | 2.85 | 13.48 | 57.38 | |
| Parakeet CTCModel Type=CTC, Align method=Gradients2026.07 | 117 | — | — | 37.1 | — | |
| MMS-FAModel Type=CTC, Align method=Gradients2026.07 | 121 | — | — | 58.2 | — | |
| Emformer (streaming)Model Type=Transd., Align method=Gradients2026.07 | 139 | — | — | 30.4 | — | |
| OWSM-CTCModel Type=CTC, Align method=Gradients2026.07 | 145 | — | — | 30.4 | — | |
| Parakeet RNN-TModel Type=Transd., Align method=Gradients2026.07 | 147 | — | — | 29.1 | — | |
| Parakeet TDTModel Type=Transd., Align method=Gradients2026.07 | 157 | — | — | 27.5 | — | |
| FastConformer (streaming)Model Type=CTC, Align method=Gradients2026.07 | 158 | — | — | 30.1 | — | |
| OWLS-1BModel Type=AED, Align method=Gradients2026.07 | 180 | — | — | 32.9 | — | |
| FastConformer (streaming)Model Type=Transd., Align method=Gradients2026.07 | 189 | — | — | 24 | — | |
| Canary-QwenModel Type=Speech LLM, Align method=Self-att.2026.07 | 211 | — | — | 16.3 | — | |
| FastConformer (streaming)Model Type=Transd., Align method=Posteriors2026.07 | 331 | — | — | 3.9 | — | |
| FastConformer (streaming)Model Type=CTC, Align method=Posteriors2026.07 | 366 | — | — | 2.2 | — | |
| Emformer (streaming)Model Type=Transd., Align method=Posteriors2026.07 | 399 | — | — | 0.5 | — |