Language Modeling on WikiText (Word Perplexity)
2.9Word Perplexity16-bit
Evaluation Results
| Method | Links | |
|---|---|---|
| 16-bitModel Family=Llama, Model Size=3-70B, Quantization Setting=16-bit2026.06 | 2.9 | |
| DenseModel=LLaMA-2, Size=70B, Sparsity=0%2025.11 | 3.12 | |
| DenseModel=LLaMA-1, Size=65B, Sparsity=0%2025.11 | 3.56 | |
| OffQModel Family=Llama, Model Size=3-70B, Quantization Setting=W4A4KV42026.06 | 3.88 | |
| 16-bitModel Family=Qwen 2.5, Model Size=72B, Quantization Setting=16-bit2026.06 | 3.9 | |
| SparseGPTModel=LLaMA-2, Size=70B, Weight Update=true, Sparsity=50%, Human Expert=true2025.11 | 3.98 | |
| WandaModel=LLaMA-2, Size=70B, Weight Update=false, Sparsity=50%, Human Expert=true2025.11 | 3.98 | |
| AutoPruneModel=LLaMA-2, Size=70B, Weight Update=false, Sparsity=50%, Human Expert=false2025.11 | 4 | |
| OSTQuantModel Family=Llama, Model Size=3-70B, Quantization Setting=W4A4KV42026.06 | 4.01 | |
| ResQModel Family=Llama, Model Size=3-70B, Quantization Setting=W4A4KV42026.06 | 4.1 | |
| KurTailModel Family=Llama, Model Size=3-70B, Quantization Setting=W4A4KV42026.06 | 4.2 | |
| OffQModel Family=Qwen 2.5, Model Size=72B, Quantization Setting=W4A4KV42026.06 | 4.29 | |
| AutoPruneModel=LLaMA-2, Size=70B, Weight Update=false, Sparsity=4:8, Human Expert=false2025.11 | 4.45 | |
| WandaModel=LLaMA-2, Size=70B, Weight Update=false, Sparsity=4:8, Human Expert=true2025.11 | 4.47 | |
| DenseModel=LLaMA-2, Size=13B, Sparsity=0%2025.11 | 4.57 | |
| SparseGPTModel=LLaMA-1, Size=65B, Weight Update=true, Sparsity=50%, Human Expert=true2025.11 | 4.57 | |
| WandaModel=LLaMA-1, Size=65B, Weight Update=false, Sparsity=50%, Human Expert=true2025.11 | 4.57 | |
| SparseGPTModel=LLaMA-2, Size=70B, Weight Update=true, Sparsity=4:8, Human Expert=true2025.11 | 4.59 | |
| ResQModel Family=Qwen 2.5, Model Size=72B, Quantization Setting=W4A4KV42026.06 | 4.6 | |
| AutoPruneModel=LLaMA-1, Size=65B, Weight Update=false, Sparsity=50%, Human Expert=false2025.11 | 4.71 | |
| DenseModel=LLaMA-1, Size=30B, Sparsity=0%2025.11 | 4.77 | |
| AutoPruneModel=LLaMA-2, Size=70B, Weight Update=false, Sparsity=60%, Human Expert=false2025.11 | 4.78 | |
| 16-bitModel Family=Llama, Model Size=2-13B, Quantization Setting=16-bit2026.06 | 4.9 | |
| QuaRotModel Family=Qwen 2.5, Model Size=72B, Quantization Setting=W4A4KV42026.06 | 4.9 | |
| AutoPruneModel=LLaMA-2, Size=70B, Weight Update=false, Sparsity=2:4, Human Expert=false2025.11 | 4.97 | |
| MagnitudeModel=LLaMA-2, Size=70B, Weight Update=false, Sparsity=50%, Human Expert=true2025.11 | 4.98 | |
| SparseGPTModel=LLaMA-2, Size=70B, Weight Update=true, Sparsity=60%, Human Expert=true2025.11 | 4.98 | |
| WandaModel=LLaMA-2, Size=70B, Weight Update=false, Sparsity=60%, Human Expert=true2025.11 | 4.98 | |
| 16-bitModel Family=Qwen 2.5, Model Size=32B, Quantization Setting=16-bit2026.06 | 5 | |
| DFRotModel Family=Llama, Model Size=3-70B, Quantization Setting=W4A4KV42026.06 | 5.03 | |
| DenseModel=LLaMA-1, Size=13B, Sparsity=0%2025.11 | 5.09 | |
| ResQModel Family=Llama, Model Size=2-13B, Quantization Setting=W4A4KV42026.06 | 5.1 | |
| OffQModel Family=Llama, Model Size=2-13B, Quantization Setting=W4A4KV42026.06 | 5.11 | |
| DenseModel=LLaMA-2, Size=7B, Sparsity=0%2025.11 | 5.12 | |
| WandaModel=LLaMA-2, Size=70B, Weight Update=false, Sparsity=2:4, Human Expert=true2025.11 | 5.16 | |
| AutoPruneModel=LLaMA-1, Size=30B, Weight Update=false, Sparsity=50%, Human Expert=false2025.11 | 5.18 | |
| SpinQuantModel Family=Llama, Model Size=2-13B, Quantization Setting=W4A4KV42026.06 | 5.2 | |
| KurTailModel Family=Llama, Model Size=2-13B, Quantization Setting=W4A4KV42026.06 | 5.2 | |
| WandaModel=LLaMA-1, Size=30B, Weight Update=false, Sparsity=50%, Human Expert=true2025.11 | 5.24 | |
| OSTQuantModel Family=Llama, Model Size=2-13B, Quantization Setting=W4A4KV42026.06 | 5.25 | |
| FP16Family=Qwen2.5, Model=Qwen2.5-14B, W/A/KV=16/16/162026.04 | 5.29 | |
| AutoPruneModel=LLaMA-1, Size=65B, Weight Update=false, Sparsity=4:8, Human Expert=false2025.11 | 5.29 | |
| WandaModel=LLaMA-1, Size=65B, Weight Update=false, Sparsity=4:8, Human Expert=true2025.11 | 5.3 | |
| 16-bitModel Family=Qwen 2.5, Model Size=14B, Quantization Setting=16-bit2026.06 | 5.3 | |
| SparseGPTModel=LLaMA-1, Size=30B, Weight Update=true, Sparsity=50%, Human Expert=true2025.11 | 5.31 | |
| SparseGPTModel=LLaMA-1, Size=65B, Weight Update=true, Sparsity=4:8, Human Expert=true2025.11 | 5.38 | |
| SparseGPTModel=LLaMA-2, Size=70B, Weight Update=true, Sparsity=2:4, Human Expert=true2025.11 | 5.4 | |
| QuaRotModel Family=Llama, Model Size=2-13B, Quantization Setting=W4A4KV42026.06 | 5.4 | |
| AutoPruneModel=LLaMA-2, Size=13B, Weight Update=false, Sparsity=50%, Human Expert=false2025.11 | 5.43 | |
| DFRotModel Family=Llama, Model Size=2-13B, Quantization Setting=W4A4KV42026.06 | 5.43 | |
| 16-bitModel Family=Llama, Model Size=2-7B, Quantization Setting=16-bit2026.06 | 5.5 | |
| OffQModel Family=Qwen 2.5, Model Size=32B, Quantization Setting=W4A4KV42026.06 | 5.52 | |
| MagnitudeModel=LLaMA-2, Size=70B, Weight Update=false, Sparsity=4:8, Human Expert=true2025.11 | 5.54 | |
| WandaModel=LLaMA-2, Size=13B, Weight Update=false, Sparsity=50%, Human Expert=true2025.11 | 5.56 | |
| ResQModel Family=Qwen 2.5, Model Size=32B, Quantization Setting=W4A4KV42026.06 | 5.6 | |
| SparseGPTModel=LLaMA-2, Size=13B, Weight Update=true, Sparsity=50%, Human Expert=true2025.11 | 5.63 | |
| DenseModel=LLaMA-1, Size=7B, Sparsity=0%2025.11 | 5.68 | |
| QuaRotModel Family=Llama, Model Size=3-70B, Quantization Setting=W4A4KV42026.06 | 5.7 | |
| OffQModel Family=Llama, Model Size=2-7B, Quantization Setting=W4A4KV42026.06 | 5.77 | |
| AutoPruneModel=LLaMA-1, Size=65B, Weight Update=false, Sparsity=60%, Human Expert=false2025.11 | 5.79 | |
| AutoPruneModel=LLaMA-1, Size=30B, Weight Update=false, Sparsity=4:8, Human Expert=false2025.11 | 5.79 | |
| ResQModel Family=Llama, Model Size=2-7B, Quantization Setting=W4A4KV42026.06 | 5.8 | |
| SparseGPTModel=LLaMA-1, Size=65B, Weight Update=true, Sparsity=60%, Human Expert=true2025.11 | 5.82 | |
| WandaModel=LLaMA-1, Size=65B, Weight Update=false, Sparsity=60%, Human Expert=true2025.11 | 5.83 | |
| BaseModel=LLaMA-3.1-8B, Compression=0%, Mode=Zero-shot2025.10 | 5.84 | |
| MagnitudeModel=LLaMA-1, Size=65B, Weight Update=false, Sparsity=50%, Human Expert=true2025.11 | 5.9 | |
| KurTailModel Family=Llama, Model Size=2-7B, Quantization Setting=W4A4KV42026.06 | 5.9 | |
| OSTQuantModel Family=Llama, Model Size=2-7B, Quantization Setting=W4A4KV42026.06 | 5.91 | |
| WandaModel=LLaMA-1, Size=30B, Weight Update=false, Sparsity=4:8, Human Expert=true2025.11 | 5.97 | |
| SpinQuantModel Family=Llama, Model Size=2-7B, Quantization Setting=W4A4KV42026.06 | 6 | |
| AutoPruneModel=LLaMA-1, Size=13B, Weight Update=false, Sparsity=50%, Human Expert=false2025.11 | 6.02 | |
| AutoPruneModel=LLaMA-1, Size=65B, Weight Update=false, Sparsity=2:4, Human Expert=false2025.11 | 6.04 | |
| OffQModel Family=Qwen 2.5, Model Size=14B, Quantization Setting=W4A4KV42026.06 | 6.07 | |
| 16-bitModel Family=Llama, Model Size=3-8B, Quantization Setting=16-bit2026.06 | 6.1 | |
| QuaRotModel Family=Llama, Model Size=2-7B, Quantization Setting=W4A4KV42026.06 | 6.1 | |
| QuaRotModel Family=Qwen 2.5, Model Size=32B, Quantization Setting=W4A4KV42026.06 | 6.1 | |
| WandaModel=LLaMA-1, Size=13B, Weight Update=false, Sparsity=50%, Human Expert=true2025.11 | 6.15 | |
| AutoPruneModel=LLaMA-2, Size=13B, Weight Update=false, Sparsity=4:8, Human Expert=false2025.11 | 6.16 | |
| SparseGPTModel=LLaMA-1, Size=30B, Weight Update=true, Sparsity=4:8, Human Expert=true2025.11 | 6.17 | |
| SpinQuantModel Family=Llama, Model Size=3-70B, Quantization Setting=W4A4KV42026.06 | 6.2 | |
| ResQModel Family=Qwen 2.5, Model Size=14B, Quantization Setting=W4A4KV42026.06 | 6.2 | |
| SparseGPTModel=LLaMA-1, Size=13B, Weight Update=true, Sparsity=50%, Human Expert=true2025.11 | 6.21 | |
| WandaModel=LLaMA-1, Size=65B, Weight Update=false, Sparsity=2:4, Human Expert=true2025.11 | 6.25 | |
| DFRotModel Family=Llama, Model Size=2-7B, Quantization Setting=W4A4KV42026.06 | 6.25 | |
| AutoPruneModel=LLaMA-2, Size=7B, Weight Update=false, Sparsity=50%, Human Expert=false2025.11 | 6.28 | |
| SparseGPTModel=LLaMA-1, Size=65B, Weight Update=true, Sparsity=2:4, Human Expert=true2025.11 | 6.28 | |
| AutoPruneModel=LLaMA-1, Size=30B, Weight Update=false, Sparsity=60%, Human Expert=false2025.11 | 6.31 | |
| MagnitudeModel=LLaMA-2, Size=70B, Weight Update=false, Sparsity=2:4, Human Expert=true2025.11 | 6.33 | |
| MagnitudeModel=LLaMA-1, Size=65B, Weight Update=false, Sparsity=4:8, Human Expert=true2025.11 | 6.36 | |
| MagnitudeModel=LLaMA-2, Size=13B, Weight Update=false, Sparsity=50%, Human Expert=true2025.11 | 6.37 | |
| WandaModel=LLaMA-2, Size=7B, Weight Update=false, Sparsity=50%, Human Expert=true2025.11 | 6.42 | |
| CoQuantFamily=Qwen2.5, Model=Qwen2.5-14B, W/A/KV=4.5/4.5/4.52026.04 | 6.48 | |
| WandaModel=LLaMA-1, Size=30B, Weight Update=false, Sparsity=60%, Human Expert=true2025.11 | 6.49 | |
| ResQFamily=Qwen2.5, Model=Qwen2.5-14B, W/A/KV=4.5/4.5/4.52026.04 | 6.5 | |
| AutoPruneModel=LLaMA-1, Size=30B, Weight Update=false, Sparsity=2:4, Human Expert=false2025.11 | 6.5 | |
| SparseGPTModel=LLaMA-2, Size=7B, Weight Update=true, Sparsity=50%, Human Expert=true2025.11 | 6.51 | |
| WandaModel=LLaMA-2, Size=13B, Weight Update=false, Sparsity=4:8, Human Expert=true2025.11 | 6.55 | |
| SparseGPTModel=LLaMA-2, Size=13B, Weight Update=true, Sparsity=4:8, Human Expert=true2025.11 | 6.6 | |
| SparseGPTModel=LLaMA-1, Size=30B, Weight Update=true, Sparsity=60%, Human Expert=true2025.11 | 6.66 | |
| MagnitudeModel=LLaMA-2, Size=13B, Weight Update=false, Sparsity=4:8, Human Expert=true2025.11 | 6.76 |