Character-level reasoning on CUTE
51.2Accuracy (CUTE Overall)ByteFlow Net 1.3B
Evaluation Results
| Method | Links | |||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| ByteFlow Net 1.3BTraining Tokens=500B tokens2026.03 | 51.2 | 52.8 | 70.1 | 33.2 | 73.4 | 16.9 | 28.7 | 95.1 | 45.3 | 68.9 | 10.1 | |
| Llama 3*Training Tokens=1T tokens2026.03 | 27.5 | 0 | 55.1 | 34.6 | 27.5 | 7.5 | 33.5 | 30.1 | 0.4 | 16.4 | 2.6 | |
| Llama 3.1*Training Tokens=16T tokens2026.03 | 20 | 0 | 21.6 | 34.3 | 84.5 | 0 | 63.3 | 3.6 | 1.2 | 6.8 | 2.4 |