Language Modeling on WikiText-2 context length 2048 (test)
7.15PerplexityScaleBITS + RTN
Evaluation Results
| Method | Links | |
|---|---|---|
| ScaleBITS + RTNBackbone=Llama2-7B, MP (Mixed-precision)=true, Granularity=block, bits=2.3, Quantizer Type=uniform2026.02 | 7.15 | |
| ICQuantBackbone=Llama2-7B, MP (Mixed-precision)=false, Granularity=element, bits=2.3, Quantizer Type=non-uniform2026.02 | 7.21 | |
| ScaleBITS + RTNBackbone=Llama2-7B, MP (Mixed-precision)=true, Granularity=block, bits=2.1, Quantizer Type=uniform2026.02 | 8.08 | |
| AMQBackbone=Llama2-7B, MP (Mixed-precision)=true, Granularity=layer, bits=2.5, Quantizer Type=uniform2026.02 | 9.24 | |
| SqueezeLLMBackbone=Llama2-7B, MP (Mixed-precision)=true, Granularity=element, bits=2.2, Quantizer Type=non-uniform2026.02 | 10.79 | |
| SlimLLM+Backbone=Llama2-7B, MP (Mixed-precision)=true, Granularity=channel group, bits=2.1, Quantizer Type=uniform2026.02 | 10.87 | |
| PB-LLMBackbone=Llama2-7B, MP (Mixed-precision)=true, Granularity=element, bits=2.5, Quantizer Type=uniform2026.02 | 24.53 |