ResearchBenchmarksInference Efficiency on LLaMA-2-7BFollow35.8Throughput (tok/s)PALS24.8827.71530.5533.385Jul 8, 2026Evaluation ResultsMethodMethodLinksThroughput (tok/s)Inference Memory (GB)Model Size (GB)PALSSparsity=50%, Hardware...Sparsity=50%, Hardware=A100, Batch Size=1, Sequence Length=5122026.0735.8126.6DenseSparsity=0%, Hardware=...Sparsity=0%, Hardware=A100, Batch Size=1, Sequence Length=5122026.0725.313.213.2