Long-context language modeling on Matched Quality Evaluation Suite (32K)
79.39Q* Score (Dense)Dense-KV
Evaluation Results
| Method | Links | |||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Dense-KVLLM (Backbone)=GPT-oss2026.05 | 79.39 | — | — | 104.9 | — | — | 1,927.5 | — | — | 0.063 | — | |
| Dense-KVLLM (Backbone)=Qwen2.5-14B2026.05 | 77.56 | — | — | 93.3 | — | — | 2,191.6 | — | — | 0.072 | — | |
| Dense-KVLLM (Backbone)=Llama-3.1-8B2026.05 | 75.65 | — | — | 110 | — | — | 1,863.6 | — | — | 0.061 | — | |
| Spherical KVLLM (Backbone)=Llama-3.1-8B2026.05 | — | 75.01 | 0.64 | — | 183 | 1.66 | — | 1,256.6 | 32.6 | — | 0.041 | |
| Spherical KVLLM (Backbone)=Qwen2.5-14B2026.05 | — | 76.9 | 0.66 | — | 153.9 | 1.65 | — | 1,413.4 | 35.5 | — | 0.046 | |
| Spherical KVLLM (Backbone)=GPT-oss2026.05 | — | 79.03 | 0.35 | — | 172.5 | 1.64 | — | 1,329.8 | 31 | — | 0.044 |