Mathematical Reasoning on MATH500
96.23AccuracyBLASST
Evaluation Results
| Method | Links | |
|---|---|---|
| BLASSTModel=Qwen3-8B, Sparsity=~50%, Deployment Phase=Decode Phase2025.12 | 96.23 | |
| BLASSTModel=Qwen3-8B, Sparsity=~75%, Deployment Phase=Decode Phase2025.12 | 96.07 | |
| Dense AttentionModel=Qwen3-8B, Sparsity=Dense, Deployment Phase=Decode Phase2025.12 | 95.87 | |
| ReST-MCTSBackbone=Gemma-3-27B2025.11 | 93.2 | |
| ReST-MCTSBackbone=GPT-OSS-120B2025.11 | 91.6 | |
| APRMBackbone=GPT-OSS-120B2025.11 | 91.4 | |
| APRMBackbone=Gemma-3-27B2025.11 | 91.4 | |
| Hard Neg.Backbone=GPT-OSS-120B2025.11 | 91.2 | |
| ReST-MCTSBackbone=GPT-OSS-20B2025.11 | 91 | |
| APRMBackbone=GPT-OSS-20B2025.11 | 91 | |
| ARMBackbone=GPT-OSS-120B2025.11 | 89.2 | |
| ToTBackbone=Gemma-3-27B2025.11 | 88 | |
| ToTBackbone=GPT-OSS-120B2025.11 | 87.6 | |
| ToTBackbone=GPT-OSS-20B2025.11 | 87.6 | |
| FlowTracerBackbone=Qwen3-8B-Base, Context Length=8K2026.06 | 86.7 | |
| LLM-JBackbone=Gemma-3-27B2025.11 | 86.4 | |
| Hard Neg.Backbone=Gemma-3-27B2025.11 | 86 | |
| ARMBackbone=Gemma-3-27B2025.11 | 86 | |
| AttentionBackbone=Qwen3-8B-Base, Context Length=8K2026.06 | 85.9 | |
| RandomBackbone=Qwen3-8B-Base, Context Length=8K2026.06 | 85.5 | |
| LLM-JBackbone=GPT-OSS-120B2025.11 | 85.2 | |
| LLM-JBackbone=GPT-OSS-20B2025.11 | 85.2 | |
| GRPOBackbone=Qwen3-8B-Base, Context Length=8K2026.06 | 85.1 | |
| CoT-SCBackbone=GPT-OSS-120B2025.11 | 84.4 | |
| High-entropyBackbone=Qwen3-8B-Base, Context Length=8K2026.06 | 84.2 | |
| GradientBackbone=Qwen3-8B-Base, Context Length=8K2026.06 | 84.2 | |
| CorrelationBackbone=Qwen3-8B-Base, Context Length=8K2026.06 | 84.2 | |
| FlowTracerBackbone=Qwen3-4B-Base, Context Length=8K2026.06 | 83.1 | |
| GradientBackbone=Qwen3-4B-Base, Context Length=8K2026.06 | 82.3 | |
| AttentionBackbone=Qwen3-4B-Base, Context Length=8K2026.06 | 82.3 | |
| RandomBackbone=Qwen3-4B-Base, Context Length=8K2026.06 | 82 | |
| ReST-MCTSBackbone=Gemma-3-12B2025.11 | 81.4 | |
| High-entropyBackbone=Qwen3-4B-Base, Context Length=8K2026.06 | 81.2 | |
| CorrelationBackbone=Qwen3-4B-Base, Context Length=8K2026.06 | 81.2 | |
| GRPOBackbone=Qwen3-4B-Base, Context Length=8K2026.06 | 81 | |
| APRMBackbone=Gemma-3-12B2025.11 | 80 | |
| FlowTracerBackbone=Qwen3-8B-Base, Context Length=1K2026.06 | 79.7 | |
| CoT-SCBackbone=Gemma-3-27B2025.11 | 78.8 | |
| AttentionBackbone=Qwen3-8B-Base, Context Length=1K2026.06 | 78.4 | |
| High-entropyBackbone=Qwen3-8B-Base, Context Length=1K2026.06 | 78.1 | |
| CoT-SCBackbone=GPT-OSS-20B2025.11 | 78 | |
| CorrelationBackbone=Qwen3-8B-Base, Context Length=1K2026.06 | 77.9 | |
| ToTBackbone=Gemma-3-12B2025.11 | 77.6 | |
| RandomBackbone=Qwen3-8B-Base, Context Length=1K2026.06 | 77.4 | |
| GradientBackbone=Qwen3-8B-Base, Context Length=1K2026.06 | 77.3 | |
| GRPOBackbone=Qwen3-8B-Base, Context Length=1K2026.06 | 77.1 | |
| CoT-SCBackbone=Gemma-3-12B2025.11 | 76.8 | |
| FlowTracerBackbone=Qwen3-4B-Base, Context Length=1K2026.06 | 75.9 | |
| Qwen2.5-Math-7B w/ CADFTBackbone=Qwen2.5-Math-7B, Fine-tuning Protocol=CADFT, Evaluation Protocol=Average@162026.04 | 75.5 | |
| AttentionBackbone=Qwen3-4B-Base, Context Length=1K2026.06 | 74.9 | |
| High-entropyBackbone=Qwen3-4B-Base, Context Length=1K2026.06 | 74.8 | |
| RandomBackbone=Qwen3-4B-Base, Context Length=1K2026.06 | 74.4 | |
| CorrelationBackbone=Qwen3-4B-Base, Context Length=1K2026.06 | 74.4 | |
| GRPOBackbone=Qwen3-4B-Base, Context Length=1K2026.06 | 74.2 | |
| GradientBackbone=Qwen3-4B-Base, Context Length=1K2026.06 | 74.1 | |
| BLASSTModel=Llama-3.1-8B, Sparsity=~75%, Deployment Phase=Decode Phase2025.12 | 73.89 | |
| BLASSTModel=Llama-3.1-8B, Sparsity=~50%, Deployment Phase=Decode Phase2025.12 | 73.71 | |
| Dense AttentionModel=Llama-3.1-8B, Sparsity=Dense, Deployment Phase=Decode Phase2025.12 | 73.4 | |
| LLM-JBackbone=Gemma-3-12B2025.11 | 72.8 | |
| Qwen2.5-Math-1.5B w/ CADFTBackbone=Qwen2.5-Math-1.5B, Fine-tuning Protocol=CADFT, Evaluation Protocol=Average@162026.04 | 72.3 | |
| Ent-RegBase Model=Qwen2.5-14B-Base2026.05 | 71.4 | |
| PAPOBase Model=Qwen2.5-14B-Base2026.05 | 71.38 | |
| DAPOBase Model=Qwen2.5-14B-Base2026.05 | 70.03 | |
| 80/20Base Model=Qwen2.5-14B-Base2026.05 | 69.38 | |
| Qwen2.5-Math-7B w/ DFTBackbone=Qwen2.5-Math-7B, Fine-tuning Protocol=DFT, Evaluation Protocol=Average@162026.04 | 68.2 | |
| Frozen checkpointModel=Moonlight-16B-A3B-Instruct2026.05 | 67.4 | |
| Ent-RegBase Model=Qwen2.5-7B-Base2026.05 | 66.9 | |
| phi-balancingModel=Moonlight-16B-A3B-Instruct2026.05 | 66.2 | |
| PAPOBase Model=Qwen2.5-7B-Base2026.05 | 65.9 | |
| 80/20Base Model=Qwen2.5-7B-Base2026.05 | 65.67 | |
| DAPOBase Model=Qwen2.5-7B-Base2026.05 | 65.57 | |
| Qwen2.5-Math-1.5B w/ DFTBackbone=Qwen2.5-Math-1.5B, Fine-tuning Protocol=DFT, Evaluation Protocol=Average@162026.04 | 64.89 | |
| ST-MoEModel=Moonlight-16B-A3B-Instruct2026.05 | 64.8 | |
| DCCDModel Size=14B2026.02 | 58.6 | |
| BaseBase Model=Qwen2.5-14B-Base2026.05 | 56.23 | |
| Qwen2.5-Math-7B w/ SFTBackbone=Qwen2.5-Math-7B, Fine-tuning Protocol=SFT, Evaluation Protocol=Average@162026.04 | 53.96 | |
| DCCDModel Size=7B2026.02 | 52.8 | |
| BaseBase Model=Qwen2.5-7B-Base2026.05 | 50.9 | |
| DeepSeekMath-7B w/ CADFTBackbone=DeepSeekMath-7B, Fine-tuning Protocol=CADFT, Evaluation Protocol=Average@162026.04 | 47.8 | |
| CDModel Size=14B2026.02 | 47.6 | |
| CPModel Size=14B2026.02 | 47 | |
| DCCDModel Size=3B2026.02 | 46.8 | |
| CFModel Size=14B2026.02 | 45.8 | |
| CFModel Size=7B2026.02 | 44.2 | |
| Qwen2.5-Math-1.5B w/ SFTBackbone=Qwen2.5-Math-1.5B, Fine-tuning Protocol=SFT, Evaluation Protocol=Average@162026.04 | 43.76 | |
| CDModel Size=7B2026.02 | 43.6 | |
| DeepSeekMath-7B w/ DFTBackbone=DeepSeekMath-7B, Fine-tuning Protocol=DFT, Evaluation Protocol=Average@162026.04 | 41.46 | |
| CPModel Size=7B2026.02 | 40.4 | |
| Qwen2.5-Math-7BBackbone=Qwen2.5-Math-7B, Fine-tuning Protocol=None, Evaluation Protocol=Average@162026.04 | 40.12 | |
| DCCDModel Size=1.5B2026.02 | 38.2 | |
| DCCDModel Size=8B2026.02 | 35 | |
| CDModel Size=3B2026.02 | 33.4 | |
| CFModel Size=3B2026.02 | 32.4 | |
| Qwen2.5-Math-1.5BBackbone=Qwen2.5-Math-1.5B, Fine-tuning Protocol=None, Evaluation Protocol=Average@162026.04 | 31.66 | |
| LLaMA-3.1-8B w/ CADFTBackbone=LLaMA-3.1-8B, Fine-tuning Protocol=CADFT, Evaluation Protocol=Average@162026.04 | 31.2 | |
| S³Backbone=LLaDA-8B-Instruct, Decoding Strategy=S³, N (S³)=4, b (S³)=2, K (Best-of-K)=642026.04 | 30.2 | |
| CPModel Size=3B2026.02 | 30 | |
| CDModel Size=8B2026.02 | 28.6 | |
| Best-of-KBackbone=LLaDA-8B-Instruct, Decoding Strategy=Best-of-K, K (Best-of-K)=82026.04 | 28.2 | |
| LLaMA-3.1-8B w/ DFTBackbone=LLaMA-3.1-8B, Fine-tuning Protocol=DFT, Evaluation Protocol=Average@162026.04 | 27.44 |