Long-context Retrieval on LITM
100AccuracyVanilla
Evaluation Results
| Method | Links | |
|---|---|---|
| VanillaBackbone=Llama 3.3 70B Instruct, Compression Ratio=None, GPU Parallelism=4 GPUs (pipeline parallel)2025.11 | 100 | |
| kvtc 8xBackbone=Llama 3.3 70B Instruct, Compression Ratio=8x, GPU Parallelism=4 GPUs (pipeline parallel)2025.11 | 100 | |
| kvtc 10xBackbone=Llama 3.3 70B Instruct, Compression Ratio=10x, GPU Parallelism=4 GPUs (pipeline parallel)2025.11 | 100 | |
| kvtc 16xBackbone=Llama 3.3 70B Instruct, Compression Ratio=16x, GPU Parallelism=4 GPUs (pipeline parallel)2025.11 | 100 | |
| kvtc 20xBackbone=Llama 3.3 70B Instruct, Compression Ratio=20x, GPU Parallelism=4 GPUs (pipeline parallel)2025.11 | 100 |