Mathematical Reasoning on GSM8K 150 problem Llama-3.1-8B-Instruct (test)
82.67Accuracy (2 hops)Uniform Q8
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| Uniform Q8Backbone=Llama-3.1-8B-Instruct, Quantization=Q8, Mode=Static2026.05 | 82.67 | 73.33 | 69.33 | 71.33 | |
| Uniform Q4Backbone=Llama-3.1-8B-Instruct, Quantization=Q4, Mode=Static2026.05 | 82 | 75.33 | 69.33 | 76.67 | |
| FP16 shareBackbone=Llama-3.1-8B-Instruct, Precision=FP162026.05 | 81.33 | 76.67 | 75.33 | 72.67 | |
| QKVShare topo Q4Backbone=Llama-3.1-8B-Instruct, Quantization=Q4, Mode=Topology-aware mixed-precision2026.05 | 78.67 | 80.67 | 77.33 | 72 | |
| Adaptive local Q8Backbone=Llama-3.1-8B-Instruct, Quantization=Q8, Mode=Local-only controller ablation2026.05 | 76.67 | 80 | 82 | 83.33 | |
| Adaptive local Q4Backbone=Llama-3.1-8B-Instruct, Quantization=Q4, Mode=Local-only controller ablation2026.05 | 76 | 79.33 | 76.67 | 73.33 |