Language Modeling on C4 TinyLlama-1.1B-Chat v1.0
9.75Perplexity (C4)FP32
Evaluation Results
| Method | Links | |
|---|---|---|
| FP32Precision=Full-precision2026.05 | 9.75 | |
| Quant.npuPrecision=w4a8, Weight Quantization=4-bit, Granularity=per-channel2026.05 | 11.43 | |
| MoblieQuantPrecision=w4a8, Weight Quantization=4-bit, Granularity=per-channel2026.05 | 11.95 |