Multimodal Representation Evaluation on SEED-Bench
99.94Average AccuracyLightKV
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| LightKVBackbone=LLaVA-v1.5-13B, Compression Timing=During prefill, FLOPs (Tera)=12.6, Memory (GB)=0.37, TTFT (sec)=0.098, Vision Token Retention=55%2026.05 | 99.94 | 69 | |
| ElasticBackbone=LLaVA-v1.5-13B, Compression Timing=Post prefill, FLOPs (Tera)=19.3, Memory (GB)=0.31, TTFT (sec)=0.598, Vision Token Retention=55%2026.05 | 68.54 | — |