Mathematical Reasoning on Math500 (TPF, ACC)
88.2Accuracy (ACC)Qwen3-8B-Thinking†
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Qwen3-8B-Thinking†Model Type=Autoregressive2026.02 | 88.2 | 100 | |
| Alignedα=1, Model Architecture=DeepSeek-R1-Distill-Qwen-14B2025.06 | 87.4 | — | |
| TraDo-8B-Thinking + BACD + TCCFModel Type=Block Diffusion, Block Size (B)=4, Decoding=BACD + TCCF2026.02 | 85.6 | 128 | |
| TraDo-8B-Thinking + BACDModel Type=Block Diffusion, Block Size (B)=4, Decoding=BACD2026.02 | 85 | 133 | |
| TraDo-8B-ThinkingModel Type=Block Diffusion, Block Size (B)=42026.02 | 84 | 128 | |
| TDAR-8B-thinking + BACD + TCCFModel Type=Block Diffusion, Block Size (B)=16, Decoding=BACD + TCCF2026.02 | 84 | 175 | |
| TDAR-8B-thinking + BACDModel Type=Block Diffusion, Block Size (B)=16, Decoding=BACD2026.02 | 83.4 | 188 | |
| BitDeltaα=1/16, Model Architecture=DeepSeek-R1-Distill-Qwen-14B2025.06 | 82.8 | — | |
| TDAR-8B-thinkingModel Type=Block Diffusion, Block Size (B)=162026.02 | 81.6 | 162 | |
| PRINMIXα=1/16, Model Architecture=DeepSeek-R1-Distill-Qwen-14B2025.06 | 80.2 | — | |
| DiRL-8B-InstructModel Type=Block Diffusion, Block Size (B)=42026.02 | 78.2 | 230 | |
| Delta-CoMeα=1/16, Model Architecture=DeepSeek-R1-Distill-Qwen-14B2025.06 | 76.5 | — | |
| Backboneα=1, Model Architecture=DeepSeek-R1-Distill-Qwen-14B2025.06 | 76.4 | — | |
| TraDo-8B-InstructModel Type=Block Diffusion, Block Size (B)=42026.02 | 75 | 236 | |
| PRISMModel=Qwen2.5-7B, Data=DAPO-17k2026.01 | 73.2 | — | |
| GRPO (GT)Model=Qwen2.5-7B, Data=DAPO-17k2026.01 | 72 | — | |
| INT.Model=Qwen2.5-7B, Data=DAPO-17k2026.01 | 69.8 | — | |
| GRPO (GT)Model=Qwen2.5-3B, Data=MATH2026.01 | 67.2 | — | |
| PRISMModel=Qwen2.5-3B, Data=MATH2026.01 | 63.6 | — | |
| PRMModel=Qwen2.5-3B, Data=MATH2026.01 | 62 | — | |
| BaseModel=Qwen2.5-7B, Data=DAPO-17k2026.01 | 61.4 | — | |
| Fast-dLLM-v2Model Type=Block Diffusion, Block Size (B)=322026.02 | 59.4 | 281 | |
| PRMModel=Qwen2.5-7B, Data=DAPO-17k2026.01 | 58 | — | |
| BaseModel=Qwen2.5-3B, Data=MATH2026.01 | 57.8 | — | |
| Low-Rankα=1/16, Model Architecture=DeepSeek-R1-Distill-Qwen-14B2025.06 | 57.2 | — | |
| LLaDA-MoEModel Type=Masked Diffusion2026.02 | 56.6 | 270 | |
| SDAR-8B-ChatModel Type=Block Diffusion, Block Size (B)=42026.02 | 52.6 | 221 | |
| FullBackbone=Deepseek-R1-Distill-Qwen-7B2025.12 | 47 | — | |
| FullBackbone=DeepSeek-R1-Distill-Llama-8B2025.12 | 46 | — | |
| FullBackbone=Nemotron-Nano-8B2025.12 | 45 | — | |
| SnapKVBackbone=Nemotron-Nano-8B, Budget=3842025.12 | 45 | — | |
| SnapKVBackbone=DeepSeek-R1-Distill-Llama-8B, Cache Budget=2562025.12 | 44 | — | |
| SnapKVBackbone=Nemotron-Nano-8B, Budget=2562025.12 | 44 | — | |
| SnapKVBackbone=Nemotron-Nano-8B, Budget=5122025.12 | 43 | — | |
| LLaDA-1.5Model Type=Masked Diffusion2026.02 | 42.2 | 397 | |
| SnapKVBackbone=DeepSeek-R1-Distill-Llama-8B, Cache Budget=1282025.12 | 42 | — | |
| LLaDAModel Type=Masked Diffusion2026.02 | 41.2 | 391 | |
| SnapKVBackbone=DeepSeek-R1-Distill-Llama-8B, Cache Budget=3842025.12 | 41 | — | |
| SnapKVBackbone=DeepSeek-R1-Distill-Llama-8B, Cache Budget=5122025.12 | 41 | — | |
| SnapKVBackbone=Nemotron-Nano-8B, Budget=1282025.12 | 41 | — | |
| Full2025.12 | 39 | — | |
| SnapKVBackbone=Deepseek-R1-Distill-Qwen-7B, Budget=1282025.12 | 38 | — | |
| H2OBackbone=DeepSeek-R1-Distill-Llama-8B, Cache Budget=3842025.12 | 36 | — | |
| H2OBackbone=DeepSeek-R1-Distill-Llama-8B, Cache Budget=5122025.12 | 36 | — | |
| SnapKVBackbone=Deepseek-R1-Distill-Qwen-7B, Budget=2562025.12 | 36 | — | |
| SnapKVBackbone=Deepseek-R1-Distill-Qwen-7B, Budget=3842025.12 | 36 | — | |
| H2OKV cache budget=5122025.12 | 36 | — | |
| StreamingLLMKV cache budget=5122025.12 | 35 | — | |
| ShadowKVBackbone=DeepSeek-R1-Distill-Llama-8B2025.12 | 34 | — | |
| StreamingLLMBackbone=Nemotron-Nano-8B, Budget=5122025.12 | 34 | — | |
| ShadowKVBackbone=Deepseek-R1-Distill-Qwen-7B2025.12 | 33 | — | |
| H2OKV cache budget=2562025.12 | 33 | — | |
| H2OKV cache budget=3842025.12 | 33 | — | |
| KnormKV cache budget=5122025.12 | 33 | — | |
| H2OBackbone=Nemotron-Nano-8B, Budget=5122025.12 | 33 | — | |
| SnapKVBackbone=Deepseek-R1-Distill-Qwen-7B, Budget=5122025.12 | 32 | — | |
| StreamingLLMKV cache budget=3842025.12 | 32 | — | |
| H2OBackbone=DeepSeek-R1-Distill-Llama-8B, Cache Budget=2562025.12 | 31 | — | |
| H2OBackbone=Deepseek-R1-Distill-Qwen-7B, Budget=5122025.12 | 31 | — | |
| H2OBackbone=Nemotron-Nano-8B, Budget=3842025.12 | 31 | — | |
| H2OKV cache budget=1282025.12 | 30 | — | |
| H2OBackbone=Deepseek-R1-Distill-Qwen-7B, Budget=3842025.12 | 29 | — | |
| ShadowKVBackbone=Nemotron-Nano-8B2025.12 | 28 | — | |
| StreamingLLMBackbone=Deepseek-R1-Distill-Qwen-7B, Budget=5122025.12 | 26 | — | |
| StreamingLLMKV cache budget=2562025.12 | 26 | — | |
| Temporal GuidanceBackbone=Qwen3-8B, Alpha=0.52026.01 | 24.2 | — | |
| H2OBackbone=Nemotron-Nano-8B, Budget=2562025.12 | 24 | — | |
| Temporal GuidanceBackbone=Qwen3-8B, Alpha=0.42026.01 | 23.6 | — | |
| Delta-CoMeα=1/16, Model Architecture=MetaMath-14B2025.06 | 22.9 | — | |
| Alignedα=1, Model Architecture=MetaMath-14B2025.06 | 22.6 | — | |
| Temporal GuidanceBackbone=Qwen3-8B, Alpha=0.22026.01 | 22.4 | — | |
| BitDeltaα=1/16, Model Architecture=MetaMath-14B2025.06 | 22.4 | — | |
| Temporal GuidanceBackbone=Qwen3-8B, Alpha=0.12026.01 | 22.2 | — | |
| Temporal GuidanceBackbone=Qwen3-8B, Alpha=0.32026.01 | 22.2 | — | |
| ShadowKV2025.12 | 22 | — | |
| KnormKV cache budget=3842025.12 | 22 | — | |
| StreamingLLMBackbone=Nemotron-Nano-8B, Budget=3842025.12 | 22 | — | |
| PRINMIXα=1/16, Model Architecture=MetaMath-14B2025.06 | 21.7 | — | |
| Contrastive DecodingBackbone=Qwen3-8B, Amateur Model=Qwen3-0.6B2026.01 | 21.4 | — | |
| H2OBackbone=Deepseek-R1-Distill-Qwen-7B, Budget=2562025.12 | 21 | — | |
| SnapKVKV cache budget=2562025.12 | 21 | — | |
| DoLaBackbone=Qwen3-8B, Penalty=1.22026.01 | 20.6 | — | |
| Baseline (Greedy)Backbone=Qwen3-8B2026.01 | 20.4 | — | |
| H2OBackbone=DeepSeek-R1-Distill-Llama-8B, Cache Budget=1282025.12 | 20 | — | |
| RKVKV cache budget=5122025.12 | 20 | — | |
| SnapKVKV cache budget=1282025.12 | 20 | — | |
| SnapKVKV cache budget=5122025.12 | 20 | — | |
| DoLaBackbone=Qwen3-8B, Penalty=1.02026.01 | 19.4 | — | |
| StreamingLLMBackbone=Deepseek-R1-Distill-Qwen-7B, Budget=3842025.12 | 19 | — | |
| SnapKVKV cache budget=3842025.12 | 19 | — | |
| KnormKV cache budget=2562025.12 | 18 | — | |
| Contrastive DecodingBackbone=Qwen3-8B, Amateur Model=Qwen3-1.7B2026.01 | 17.8 | — | |
| RKVBackbone=Deepseek-R1-Distill-Qwen-7B, Budget=5122025.12 | 17 | — | |
| RKVKV cache budget=3842025.12 | 16 | — | |
| H2OBackbone=Nemotron-Nano-8B, Budget=1282025.12 | 16 | — | |
| Low-Rankα=1/16, Model Architecture=MetaMath-14B2025.06 | 15.8 | — | |
| H2OBackbone=Deepseek-R1-Distill-Qwen-7B, Budget=1282025.12 | 14 | — | |
| StreamingLLMBackbone=Nemotron-Nano-8B, Budget=2562025.12 | 13 | — | |
| Temporal GuidanceBackbone=Qwen3-1.7B, Alpha=0.22026.01 | 12.8 | — | |
| Baseline (Greedy)Backbone=Qwen3-1.7B2026.01 | 12.6 | — |