Long-context language modeling on Matched Quality Evaluation Suite 8K
81.35Q* Score (Dense)Dense-KV
Evaluation Results
| Method | Links | |||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Dense-KVLLM (Backbone)=Qwen2.5-14B2026.05 | 81.35 | — | — | 151.6 | — | — | 1,690.9 | — | — | 0.014 | — | |
| Dense-KVLLM (Backbone)=GPT-oss2026.05 | 79.71 | — | — | 163.7 | — | — | 1,717.1 | — | — | 0.014 | — | |
| Dense-KVLLM (Backbone)=Llama-3.1-8B2026.05 | 74.2 | — | — | 173.4 | — | — | 1,658.3 | — | — | 0.014 | — | |
| Spherical KVLLM (Backbone)=Llama-3.1-8B2026.05 | — | 73.84 | 0.37 | — | 268.5 | 1.55 | — | 1,262.3 | 23.9 | — | 0.01 | |
| Spherical KVLLM (Backbone)=Qwen2.5-14B2026.05 | — | 81.01 | 0.34 | — | 239.4 | 1.58 | — | 1,083.7 | 35.9 | — | 0.009 | |
| Spherical KVLLM (Backbone)=GPT-oss2026.05 | — | 79.19 | 0.52 | — | 261.2 | 1.6 | — | 1,220.3 | 28.9 | — | 0.01 |