Decoding Latency on Llama-3.1-8B 32k sequence length v1 (inference)
0.033Decoding Latency (s)Full Cache
Evaluation Results
| Method | Links | |
|---|---|---|
| Full CacheHardware=NVIDIA A100 (80GB, PCIe 4.0 link)2025.05 | 0.033 | |
| Full CacheHardware=NVIDIA RTX 3090 (24GB, PCIe 1.0 link)2025.05 | 0.042 | |
| TailorKVHardware=NVIDIA A100 (80GB, PCIe 4.0 link)2025.05 | 0.047 | |
| TailorKVHardware=NVIDIA RTX 3090 (24GB, PCIe 1.0 link)2025.05 | 0.067 | |
| PQCacheHardware=NVIDIA A100 (80GB, PCIe 4.0 link)2025.05 | 0.105 | |
| OffloadCacheHardware=NVIDIA A100 (80GB, PCIe 4.0 link)2025.05 | 0.227 | |
| OffloadCacheHardware=NVIDIA RTX 3090 (24GB, PCIe 1.0 link)2025.05 | 0.46 |