Language Model Inference on stories100m 110M parameters
298.7Tokens/sPyTorch (Accelerate)
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| PyTorch (Accelerate)Optimization=AMX Coprocessor2026.01 | 298.7 | 3.3 | |
| bare_metal::TransformerOptimization=NEON Manual2026.01 | 61.3 | 16.3 | |
| Scalar C++Optimization=-O3 Auto-Vect2026.01 | 24 | 41.6 |