Prompt Compression on 16K-token input
0.3Compression Latency (s)LLMLingua-2
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| LLMLingua-2Requires Neural Inf.=XLM-R (560M), Compression Granularity=Token2026.03 | 0.3 | — | |
| RECOMPRequires Neural Inf.=Trained encoder, Compression Granularity=Abstractive2026.03 | 0.5 | — | |
| Selective ContextRequires Neural Inf.=GPT-2/LLaMa, Compression Granularity=Sentence/phrase2026.03 | 1 | — | |
| LLMLinguaRequires Neural Inf.=LLaMa-7B, Compression Granularity=Token2026.03 | 2 | — | |
| vLLM Semantic RouterRequires Neural Inf.=None, Compression Granularity=Sentence2026.03 | 19 | — |