Multilingual Downstream Evaluation on FLORES+ 30-lang dataset (unbalanced)
39.04Arabic AccuracyParity-aware (hybrid)
Evaluation Results
| Method | Links | ||||||||||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Parity-aware (hybrid)Tokenizer Type=Parity-aware (hybrid), Vocabulary Size=128k, Training Corpus Distribution=unbalanced2025.08 | 39.04 | 23.54 | 34.78 | 42.55 | 38.83 | 39.15 | 36.59 | 33.92 | 40.55 | 35.01 | 37.45 | 33 | 31.14 | 33.15 | 36.21 | 32.25 | 33.52 | 38.46 | 33.87 | 38.58 | 44.15 | 40.96 | |
| Parity-aware (window+hybrid)Tokenizer Type=Parity-aware (window+hybrid), Vocabulary Size=128k, Training Corpus Distribution=unbalanced2025.08 | 38.84 | 23.91 | 36.82 | 43.16 | 39.3 | 39.15 | 37.1 | 33.86 | 40.46 | 34.62 | 37.43 | 34.33 | 28.97 | 33.06 | 36.57 | 32.19 | 33.26 | 37.89 | 33.8 | 38.32 | 43.74 | 41.06 | |
| Classical BPETokenizer Type=Classical, Vocabulary Size=128k, Training Corpus Distribution=unbalanced2025.08 | 38.19 | 24.95 | 32.92 | 41.95 | 37.53 | 42.8 | 38.67 | 33.92 | 38.95 | 32.82 | 37.43 | 33 | 29.75 | 33.63 | 36.36 | 31.32 | 32.73 | 39.04 | 33.69 | 38.43 | 43.04 | 40.76 | |
| RandomDescription=Expected accuracy of a random classifier2025.08 | 32 | 25 | 30.62 | 37.5 | 32.77 | 25 | 32 | 30.62 | 35 | 27.22 | 34 | 25 | 23.75 | 27.5 | 32.77 | 31.25 | 30 | 35 | 29.5 | 35 | 35.5 | 37.5 |