Long-context language modeling on Matched Quality Evaluation Suite 128K
80.12Q Score (Dense)Dense-KV
Evaluation Results
| Method | Links | |||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Dense-KVLLM (Backbone)=GPT-oss2026.05 | 80.12 | — | — | 59.9 | — | — | 2,442.2 | — | — | 0.32 | — | |
| Dense-KVLLM (Backbone)=Qwen2.5-14B2026.05 | 78.02 | — | — | 55.7 | — | — | 2,775.6 | — | — | 0.364 | — | |
| Dense-KVLLM (Backbone)=Llama-3.1-8B2026.05 | 76.56 | — | — | 62.9 | — | — | 2,360.6 | — | — | 0.309 | — | |
| Spherical KVLLM (Backbone)=Llama-3.1-8B2026.05 | — | 75.78 | 0.78 | — | 108 | 1.72 | — | 1,547.1 | 34.5 | — | 0.203 | |
| Spherical KVLLM (Backbone)=Qwen2.5-14B2026.05 | — | 77.4 | 0.62 | — | 94.8 | 1.7 | — | 1,607.7 | 42.1 | — | 0.211 | |
| Spherical KVLLM (Backbone)=GPT-oss2026.05 | — | 79.58 | 0.54 | — | 102.4 | 1.71 | — | 1,611.7 | 34 | — | 0.211 |