Decoding Latency on Llama-3.1-8B 16k sequence length v1 (inference)
0.024Decoding latency (s)Full Cache
Evaluation Results
| Method | Links | |
|---|---|---|
| Full CacheHardware=NVIDIA A100 (80GB, PCIe 4.0 link)2025.05 | 0.024 | |
| Full CacheHardware=NVIDIA RTX 3090 (24GB, PCIe 1.0 link)2025.05 | 0.033 | |
| TailorKVHardware=NVIDIA A100 (80GB, PCIe 4.0 link)2025.05 | 0.045 | |
| TailorKVHardware=NVIDIA RTX 3090 (24GB, PCIe 1.0 link)2025.05 | 0.062 | |
| PQCacheHardware=NVIDIA A100 (80GB, PCIe 4.0 link)2025.05 | 0.104 | |
| OffloadCacheHardware=NVIDIA A100 (80GB, PCIe 4.0 link)2025.05 | 0.124 | |
| PQCacheHardware=NVIDIA RTX 3090 (24GB, PCIe 1.0 link)2025.05 | 0.126 | |
| OffloadCacheHardware=NVIDIA RTX 3090 (24GB, PCIe 1.0 link)2025.05 | 0.242 |