Language Modeling on C4 (Word Perplexity)
18.08Word PerplexityBF16
Evaluation Results
| Method | Links | |
|---|---|---|
| BF16Model Architecture=Llama3, Model Size=8B2026.03 | 18.08 | |
| FAAR+2FAModel Architecture=Llama3, Model Size=8B2026.03 | 20.17 | |
| 4/6Model Architecture=Llama3, Model Size=8B2026.03 | 20.45 | |
| strong baselineModel Architecture=Llama3, Model Size=8B2026.03 | 20.73 | |
| RTNModel Architecture=Llama3, Model Size=8B2026.03 | 20.82 | |
| GPTQ+4/6Model Architecture=Llama3, Model Size=8B2026.03 | 20.89 | |
| MR-GPTQModel Architecture=Llama3, Model Size=8B2026.03 | 20.92 | |
| GPTQModel Architecture=Llama3, Model Size=8B2026.03 | 20.96 | |
| BF16Model Architecture=Llama3, Model Size=1B2026.03 | 28.55 | |
| FAAR+2FAModel Architecture=Llama3, Model Size=1B2026.03 | 34.41 | |
| 4/6Model Architecture=Llama3, Model Size=1B2026.03 | 35.1 | |
| GPTQ+4/6Model Architecture=Llama3, Model Size=1B2026.03 | 35.56 | |
| MR-GPTQModel Architecture=Llama3, Model Size=1B2026.03 | 35.59 | |
| GPTQModel Architecture=Llama3, Model Size=1B2026.03 | 35.62 | |
| strong baselineModel Architecture=Llama3, Model Size=1B2026.03 | 35.82 | |
| RTNModel Architecture=Llama3, Model Size=1B2026.03 | 36.19 | |
| BF16Model Architecture=Qwen3, Model Size=8B2026.03 | 36.33 | |
| FAAR+2FAModel Architecture=Qwen3, Model Size=8B2026.03 | 36.92 | |
| GPTQModel Architecture=Qwen3, Model Size=8B2026.03 | 37.14 | |
| MR-GPTQModel Architecture=Qwen3, Model Size=8B2026.03 | 37.19 | |
| GPTQ+4/6Model Architecture=Qwen3, Model Size=8B2026.03 | 37.25 | |
| 4/6Model Architecture=Qwen3, Model Size=8B2026.03 | 37.31 | |
| strong baselineModel Architecture=Qwen3, Model Size=8B2026.03 | 37.64 | |
| RTNModel Architecture=Qwen3, Model Size=8B2026.03 | 37.91 | |
| BF16Model Architecture=Qwen3, Model Size=1.7B2026.03 | 58.75 | |
| FAAR+2FAModel Architecture=Qwen3, Model Size=1.7B2026.03 | 62.24 | |
| MR-GPTQModel Architecture=Qwen3, Model Size=1.7B2026.03 | 63.31 | |
| GPTQModel Architecture=Qwen3, Model Size=1.7B2026.03 | 63.34 | |
| GPTQ+4/6Model Architecture=Qwen3, Model Size=1.7B2026.03 | 63.81 | |
| strong baselineModel Architecture=Qwen3, Model Size=1.7B2026.03 | 65.41 | |
| RTNModel Architecture=Qwen3, Model Size=1.7B2026.03 | 65.54 | |
| 4/6Model Architecture=Qwen3, Model Size=1.7B2026.03 | 66.3 |