Decoding Latency on Llama-2-7B 32k sequence length v1 (inference)
0.062Decoding Latency (s)TailorKV
Evaluation Results
| Method | Links | |
|---|---|---|
| TailorKVHardware=NVIDIA A100 (80GB, PCIe 4.0 link)2025.05 | 0.062 | |
| Full CacheHardware=NVIDIA A100 (80GB, PCIe 4.0 link)2025.05 | 0.077 | |
| TailorKVHardware=NVIDIA RTX 3090 (24GB, PCIe 1.0 link)2025.05 | 0.087 | |
| PQCacheHardware=NVIDIA A100 (80GB, PCIe 4.0 link)2025.05 | 0.111 | |
| OffloadCacheHardware=NVIDIA A100 (80GB, PCIe 4.0 link)2025.05 | 0.838 | |
| OffloadCacheHardware=NVIDIA RTX 3090 (24GB, PCIe 1.0 link)2025.05 | 1.776 |