Autoregressive Generation performance on Apple Silicon M4
556Memory (MB)Litespark-Inference
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Litespark-InferenceHardware Optimization=NEON, Quantization=int82026.05 | 556 | 288 | 20.4 | |
| Litespark-InferenceHardware Optimization=Accelerate (Apple’s AMX), Precision=float322026.05 | 6,949 | 373 | 5.52 | |
| PyTorchDescription=standard baseline2026.05 | 7,673 | 2,632 | 0.39 |