Language Modeling on Alpaca
3.22PerplexityFull
Evaluation Results
| Method | Links | |
|---|---|---|
| FullModel=LLaMA2-7B, Bits=4, Layer Execution=Full2026.02 | 3.22 | |
| FullModel=LLaMA2-7B, Bits=16, Layer Execution=Full2026.02 | 3.23 | |
| FPModel=Llama3-8B2025.03 | 3.28 | |
| HOTModel=Llama3-8B2025.03 | 3.29 | |
| FullModel=LLaMA2-7B, Bits=3, Layer Execution=Full2026.02 | 3.3 | |
| FullModel=LLaMA3.1-8B, Bits=16, Layer Execution=Full2026.02 | 3.57 | |
| FullBits=162026.02 | 3.62 | |
| FullModel=LLaMA3.1-8B, Bits=4, Layer Execution=Full2026.02 | 3.65 | |
| FullBits=42026.02 | 3.71 | |
| QTALEModel=LLaMA2-7B, Bits=4, Layer Execution=QTALE2026.02 | 3.74 | |
| HOT + LoRAModel=Llama3-8B2025.03 | 3.78 | |
| LoRAModel=Llama3-8B2025.03 | 3.8 | |
| QTALEModel=LLaMA2-7B, Bits=16, Layer Execution=QTALE2026.02 | 4.09 | |
| QTALEModel=LLaMA3.1-8B, Bits=4, Layer Execution=QTALE2026.02 | 4.11 | |
| QTALEBits=42026.02 | 4.26 | |
| D-LLMModel=LLaMA2-7B, Bits=16, Layer Execution=D-LLM2026.02 | 4.33 | |
| QTALEModel=LLaMA2-7B, Bits=3, Layer Execution=QTALE2026.02 | 4.38 | |
| D-LLMModel=LLaMA2-7B, Bits=4, Layer Execution=D-LLM2026.02 | 4.43 | |
| PCA-OT1Model=Llama-2-7b-chat-hf (32 layers)2026.03 | 4.74 | |
| PCA-OT1Model=Llama-2-13b-chat-hf (40 layers)2026.03 | 4.76 | |
| FullModel=LLaMA3.1-8B, Bits=3, Layer Execution=Full2026.02 | 4.83 | |
| RFAModel=Llama-2-13b-chat-hf (40 layers)2026.03 | 4.86 | |
| RFAModel=Llama-2-7b-chat-hf (32 layers)2026.03 | 4.89 | |
| QTALEModel=LLaMA3.1-8B, Bits=16, Layer Execution=QTALE2026.02 | 4.9 | |
| PCA-OT2Model=Llama-2-13b-chat-hf (40 layers)2026.03 | 4.9 | |
| QTALEBits=162026.02 | 4.91 | |
| AcTModel=Llama-2-7b-chat-hf (32 layers)2026.03 | 4.91 | |
| D-LLMBits=162026.02 | 4.95 | |
| Baseline (no intervention)Model=Llama-2-13b-chat-hf (40 layers)2026.03 | 4.97 | |
| Baseline (no intervention)Model=Llama-2-7b-chat-hf (32 layers)2026.03 | 4.99 | |
| D-LLMModel=LLaMA3.1-8B, Bits=16, Layer Execution=D-LLM2026.02 | 5.06 | |
| FullBits=32026.02 | 5.2 | |
| D-LLMBits=42026.02 | 5.22 | |
| QTALEModel=LLaMA3.1-8B, Bits=3, Layer Execution=QTALE2026.02 | 5.29 | |
| AcTModel=Llama-2-13b-chat-hf (40 layers)2026.03 | 5.32 | |
| D-LLMModel=LLaMA2-7B, Bits=3, Layer Execution=D-LLM2026.02 | 5.35 | |
| D-LLMModel=LLaMA3.1-8B, Bits=4, Layer Execution=D-LLM2026.02 | 5.47 | |
| QTALEBits=32026.02 | 5.54 | |
| Baseline (no intervention)Model=Qwen2.5-32B-Instruct (64 layers)2026.03 | 5.59 | |
| RFAModel=Qwen2.5-32B-Instruct (64 layers)2026.03 | 5.76 | |
| AcTModel=Qwen2.5-14B-Instruct (48 layers)2026.03 | 5.82 | |
| AcTModel=Qwen2.5-32B-Instruct (64 layers)2026.03 | 5.95 | |
| Baseline (no intervention)Model=Llama-3.1-8B-Instruct (32 layers)2026.03 | 6.01 | |
| RFAModel=Llama-3.1-8B-Instruct (32 layers)2026.03 | 6.05 | |
| Baseline (no intervention)Model=Qwen2.5-7B-Instruct (28 layers)2026.03 | 6.12 | |
| PCA-OT2Model=Llama-2-7b-chat-hf (32 layers)2026.03 | 6.22 | |
| Baseline (no intervention)Model=Qwen2.5-14B-Instruct (48 layers)2026.03 | 6.29 | |
| PCA-OT1Model=Qwen2.5-32B-Instruct (64 layers)2026.03 | 6.29 | |
| PCA-OT2Model=Qwen2.5-14B-Instruct (48 layers)2026.03 | 6.37 | |
| PCA-OT1Model=Llama-3.1-8B-Instruct (32 layers)2026.03 | 6.41 | |
| RFAModel=Qwen2.5-14B-Instruct (48 layers)2026.03 | 6.44 | |
| RFAModel=Qwen2.5-7B-Instruct (28 layers)2026.03 | 6.51 | |
| AcTModel=Qwen2.5-7B-Instruct (28 layers)2026.03 | 6.76 | |
| D-LLMModel=LLaMA3.1-8B, Bits=3, Layer Execution=D-LLM2026.02 | 7.24 | |
| AcTModel=Llama-3.1-8B-Instruct (32 layers)2026.03 | 7.31 | |
| D-LLMBits=32026.02 | 7.33 | |
| PCA-OT2Model=Qwen2.5-32B-Instruct (64 layers)2026.03 | 7.45 | |
| PCA-OT2Model=Llama-3.1-8B-Instruct (32 layers)2026.03 | 7.51 | |
| PCA-OT1Model=Qwen2.5-14B-Instruct (48 layers)2026.03 | 8.07 | |
| PCA-OT1Model=Qwen2.5-7B-Instruct (28 layers)2026.03 | 12.92 | |
| PCA-OT2Model=Qwen2.5-7B-Instruct (28 layers)2026.03 | 24.66 |