Decoding Latency on Llama-2-7B 16k sequence length v1 (inference)
0.041Decoding Latency (s)TailorKV
Evaluation Results
| Method | Links | |
|---|---|---|
| TailorKVHardware=NVIDIA A100 (80GB, PCIe 4.0 link)2025.05 | 0.041 | |
| Full CacheHardware=NVIDIA A100 (80GB, PCIe 4.0 link)2025.05 | 0.045 | |
| TailorKVHardware=NVIDIA RTX 3090 (24GB, PCIe 1.0 link)2025.05 | 0.067 | |
| PQCacheHardware=NVIDIA A100 (80GB, PCIe 4.0 link)2025.05 | 0.108 | |
| OffloadCacheHardware=NVIDIA A100 (80GB, PCIe 4.0 link)2025.05 | 0.433 | |
| OffloadCacheHardware=NVIDIA RTX 3090 (24GB, PCIe 1.0 link)2025.05 | 0.893 |