ResearchBenchmarksLLM Inference Efficiency on Synthetic LLM Workload Input 8192 Output 4096Follow162.78Latency (s)ShotKV161.9544167.5272173.1178.6728Feb 4, 2025Evaluation ResultsMethodMethodLinksLatency (s)Throughput (T/S)ShotKVInput Sequence Length=...Input Sequence Length=8192, Output Sequence Length=4096, Batch size=1, Hardware server=A40 server2025.02162.7863.24FullKVInput Sequence Length=...Input Sequence Length=8192, Output Sequence Length=4096, Batch size=1, Hardware server=A40 server2025.02183.4255.93