Mathematical Reasoning on AIME24 (Accuracy and Length)
68.2AccuracyFull Attention
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Full AttentionBackbone=Qwen3-4B, Constraint=Full (No Budget)2026.06 | 68.2 | 14,625.3 | |
| GraphPOModel=Deepseek-R1-Distill-Qwen-7B2026.06 | 66.2 | — | |
| PROSModel=Deepseek-R1-Distill-Qwen-7B2026.06 | 63.2 | — | |
| SPOModel=Deepseek-R1-Distill-Qwen-7B2026.06 | 62.6 | — | |
| TREE-GRPOModel=Deepseek-R1-Distill-Qwen-7B2026.06 | 61.7 | — | |
| TreePOModel=Deepseek-R1-Distill-Qwen-7B2026.06 | 61.6 | — | |
| TreeRLModel=Deepseek-R1-Distill-Qwen-7B2026.06 | 60.7 | — | |
| DAPOModel=Deepseek-R1-Distill-Qwen-7B2026.06 | 59 | — | |
| GRPOModel=Deepseek-R1-Distill-Qwen-7B2026.06 | 57.2 | — | |
| VanillaBackbone=Qwen3-4B, Selection Method=Vanilla, Top-k Budget=40962026.06 | 56.7 | 18,706.9 | |
| HARD-KVBackbone=Qwen3-4B, Selection Method=RKV, Top-k Budget=4096, Top-p Budget=0.902026.06 | 56.5 | 28,267.2 | |
| HARD-KVBackbone=Qwen3-4B, Selection Method=SnapKV, Top-k Budget=4096, Top-p Budget=0.902026.06 | 55.4 | 20,931.6 | |
| DASTbackbone=DeepSeek-R1-Distill-Qwen-7B2026.05 | 54.3 | 10,924 | |
| AdaptThinkbackbone=DeepSeek-R1-Distill-Qwen-7B2026.05 | 54.2 | 9,565 | |
| Originalbackbone=DeepSeek-R1-Distill-Qwen-7B2026.05 | 53.8 | 11,731 | |
| λ-GRPOModel Scale=Qwen3-8B2025.08 | 53.33 | — | |
| SLATbackbone=DeepSeek-R1-Distill-Qwen-7B2026.05 | 52.9 | 6,105 | |
| TLMREbackbone=DeepSeek-R1-Distill-Qwen-7B, alpha=0.12026.05 | 52.8 | 9,454 | |
| LC-R1backbone=DeepSeek-R1-Distill-Qwen-7B2026.05 | 52.3 | 6,835 | |
| BaseModel=Deepseek-R1-Distill-Qwen-7B2026.06 | 51.7 | — | |
| TLMREbackbone=DeepSeek-R1-Distill-Qwen-7B, alpha=0.22026.05 | 51.2 | 8,987 | |
| RKVBackbone=Qwen3-4B, Selection Method=RKV, Top-k Budget=40962026.06 | 50 | 18,967.4 | |
| VRPOModel Scale=Qwen3-1.7B2025.08 | 46.67 | — | |
| VRPOModel Scale=Qwen3-8B2025.08 | 46.67 | — | |
| Reinforce++Model Scale=Qwen3-8B2025.08 | 45 | — | |
| Dr.GRPOModel Scale=Qwen3-8B2025.08 | 45 | — | |
| HARD-KVBackbone=Qwen3-4B, Selection Method=RKV, Top-k Budget=2048, Top-p Budget=0.902026.06 | 43.3 | 31,788 | |
| L1-Maxbackbone=DeepSeek-R1-Distill-Qwen-7B2026.05 | 42.9 | 4,135 | |
| Reinforce++Model Scale=Qwen3-1.7B2025.08 | 41.67 | — | |
| BaseModel Scale=Qwen3-8B2025.08 | 41.67 | — | |
| HARD-KVBackbone=Qwen3-4B, Selection Method=SnapKV, Top-k Budget=2048, Top-p Budget=0.902026.06 | 40.2 | 29,201.6 | |
| λ-GRPOModel Scale=Qwen3-1.7B2025.08 | 40 | — | |
| HARD-KVBackbone=Qwen3-4B, Selection Method=Vanilla, Top-k Budget=2048, Top-p Budget=0.902026.06 | 39.9 | 30,273.2 | |
| KTAEModel Scale=Qwen3-8B2025.08 | 38.33 | — | |
| GraphPOModel=Qwen3-8B-Base2026.06 | 38.2 | — | |
| VanillaBackbone=Qwen3-4B, Selection Method=Vanilla, Top-k Budget=20482026.06 | 36.7 | 28,846.5 | |
| SnapKVBackbone=Qwen3-4B, Selection Method=SnapKV, Top-k Budget=40962026.06 | 36.7 | 19,007.7 | |
| Dr.GRPOModel Scale=Qwen3-1.7B2025.08 | 36.67 | — | |
| PPOModel Scale=Qwen3-8B2025.08 | 36.67 | — | |
| HARD-KVBackbone=Qwen3-4B, Selection Method=Vanilla, Top-k Budget=4096, Top-p Budget=0.902026.06 | 36.6 | 30,864.9 | |
| SnapKVBackbone=Qwen3-4B, Selection Method=SnapKV, Top-k Budget=20482026.06 | 36 | 29,044.4 | |
| BaseModel Scale=Qwen3-1.7B2025.08 | 35 | — | |
| PPOModel Scale=Qwen3-1.7B2025.08 | 35 | — | |
| GRPOModel Scale=Qwen3-8B2025.08 | 35 | — | |
| PROSModel=Qwen3-8B-Base2026.06 | 34.3 | — | |
| SPOModel=Qwen3-8B-Base2026.06 | 34.1 | — | |
| GRPOModel Scale=Qwen3-1.7B2025.08 | 33.33 | — | |
| TREE-GRPOModel=Qwen3-8B-Base2026.06 | 33.2 | — | |
| TreePOModel=Qwen3-8B-Base2026.06 | 33.1 | — | |
| DAPOModel=Qwen3-8B-Base2026.06 | 32.3 | — | |
| TreeRLModel=Qwen3-8B-Base2026.06 | 32.3 | — | |
| GraphPOModel=Qwen2.5-7B-Math2026.06 | 32.1 | — | |
| GRPOModel=Qwen3-8B-Base2026.06 | 30.3 | — | |
| BaseModel=Qwen3-8B-Base2026.06 | 29.3 | — | |
| PROSModel=Qwen2.5-7B-Math2026.06 | 29.1 | — | |
| SPOModel=Qwen2.5-7B-Math2026.06 | 28.5 | — | |
| TREE-GRPOModel=Qwen2.5-7B-Math2026.06 | 27.2 | — | |
| TreePOModel=Qwen2.5-7B-Math2026.06 | 26.8 | — | |
| RKVBackbone=Qwen3-4B, Selection Method=RKV, Top-k Budget=20482026.06 | 26.7 | 26,245.9 | |
| TreeRLModel=Qwen2.5-7B-Math2026.06 | 26.1 | — | |
| DAPOModel=Qwen2.5-7B-Math2026.06 | 25.7 | — | |
| HARD-KVBackbone=Qwen3-4B, Selection Method=Vanilla, Top-k Budget=1024, Top-p Budget=0.902026.06 | 24 | 31,790.8 | |
| HARD-KVBackbone=Qwen3-4B, Selection Method=RKV, Top-k Budget=1024, Top-p Budget=0.902026.06 | 23.4 | 31,036.7 | |
| GRPOModel=Qwen2.5-7B-Math2026.06 | 23.3 | — | |
| KTAEModel Scale=Qwen3-1.7B2025.08 | 18.33 | — | |
| BaseModel=Qwen2.5-7B-Math2026.06 | 13.6 | — | |
| HARD-KVBackbone=Qwen3-4B, Selection Method=SnapKV, Top-k Budget=1024, Top-p Budget=0.902026.06 | 10.7 | 32,768 | |
| VanillaBackbone=Qwen3-4B, Selection Method=Vanilla, Top-k Budget=10242026.06 | 3.3 | 32,768 | |
| RKVBackbone=Qwen3-4B, Selection Method=RKV, Top-k Budget=10242026.06 | 3.3 | 26,750.1 | |
| SnapKVBackbone=Qwen3-4B, Selection Method=SnapKV, Top-k Budget=10242026.06 | 3.2 | 32,652.4 |