Mathematical Reasoning on MATH 500 (ACC, LEN, delta_LEN)
99.1AccuracyQwen3-Base (DICE-PC)
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| Qwen3-Base (DICE-PC)Size=3×4B2026.06 | 99.1 | — | — | — | — | |
| OpenAI o3Size=–2026.06 | 98.9 | — | — | — | — | |
| Qwen3-235B-A22BSize=235B2026.06 | 98.8 | — | — | — | — | |
| Qwen3-Base (DICE-FT)Size=3×4B2026.06 | 98.6 | — | — | — | — | |
| Qwen3-A3BSize=30B2026.06 | 98 | — | — | — | — | |
| QwQSize=32B2026.06 | 98 | — | — | — | — | |
| OpenAI o3-miniSize=–2026.06 | 98 | — | — | — | — | |
| Qwen3-Inst (SC@64)Size=14B2026.06 | 97.9 | — | — | — | — | |
| Qwen3 (thinking)Size=32B2026.06 | 97.2 | — | — | — | — | |
| Qwen3-Inst (Few-shot CoT)Size=4B2026.06 | 96.8 | — | — | — | — | |
| Qwen3-Base Debate+Judge (FT)Size=3×8B2026.06 | 95.9 | — | — | — | — | |
| Qwen3-Base Role-play (FT)Size=3×8B2026.06 | 95.7 | — | — | — | — | |
| SRQ-driven steeringBackbone=Qwen3-4B-Thinking, Steering Mechanism=Conceptor2026.04 | 95.6 | — | — | — | — | |
| Qwen3-Inst Debate+Judge (prompt)Size=3×4B2026.06 | 95.3 | — | — | — | — | |
| SRQ-driven steeringBackbone=Qwen3-4B-Thinking, Steering Mechanism=PCA-CAA2026.04 | 95.2 | — | — | — | — | |
| Qwen3-Base Debate+Judge (FT)Size=3×4B2026.06 | 95.2 | — | — | — | — | |
| Qwen3-Base Debate (FT)Size=3×8B2026.06 | 95.2 | — | — | — | — | |
| Qwen3-Base Role-play (FT)Size=3×4B2026.06 | 95 | — | — | — | — | |
| SRQ-driven steeringBackbone=Qwen3-4B-Thinking, Steering Mechanism=CAA2026.04 | 94.8 | — | — | — | — | |
| Qwen3-Inst Role-play (prompt)Size=3×4B2026.06 | 94.7 | — | — | — | — | |
| ConceptorBackbone=Qwen3-4B-Thinking2026.04 | 94.6 | — | — | — | — | |
| Qwen3-Base Debate (FT)Size=3×4B2026.06 | 94.6 | — | — | — | — | |
| DeepSeek-R1 DistillSize=70B2026.06 | 94.5 | — | — | — | — | |
| PCA-CAABackbone=Qwen3-4B-Thinking2026.04 | 94.4 | — | — | — | — | |
| Base LLMBackbone=Qwen3-4B-Thinking2026.04 | 94.2 | — | — | — | — | |
| CAABackbone=Qwen3-4B-Thinking2026.04 | 94.2 | — | — | — | — | |
| Qwen3-Inst Debate (prompt)Size=3×4B2026.06 | 94.1 | — | — | — | — | |
| SLATbackbone=DeepSeek-R1-Distill-Qwen-7B2026.05 | 92.8 | 1,820 | — | — | — | |
| Qwen3-Base-DAPOSize=14B2026.06 | 92.7 | — | — | — | — | |
| DASTbackbone=DeepSeek-R1-Distill-Qwen-7B2026.05 | 92.4 | 3,228 | — | — | — | |
| Qwen3-Base-GRPOSize=14B2026.06 | 92.2 | — | — | — | — | |
| FTBit-Precision=BF16, Total fine-tuning tokens=350M2026.06 | 92.18 | — | — | — | — | |
| STARE-C2Scenario=Long CoT, Backbone Model=DeepSeek-R1-Distill-Qwen-1.5B, Model Scale=1.5B2026.06 | 92.1 | — | — | — | — | |
| Originalbackbone=DeepSeek-R1-Distill-Qwen-7B2026.05 | 91.9 | 3,860 | — | — | — | |
| JustRLScenario=Long CoT, Backbone Model=DeepSeek-R1-Distill-Qwen-1.5B, Model Scale=1.5B2026.06 | 91.7 | — | — | — | — | |
| AdaptThinkbackbone=DeepSeek-R1-Distill-Qwen-7B2026.05 | 91.6 | 1,893 | — | — | — | |
| Qwen3-Base-DAPOSize=8B2026.06 | 91.5 | — | — | — | — | |
| A3POScenario=Long CoT, Backbone Model=Qwen3-8B-Base, Model Scale=8B2026.06 | 91.3 | — | — | — | — | |
| TLMREbackbone=DeepSeek-R1-Distill-Qwen-7B, alpha=0.12026.05 | 91.2 | 2,662 | — | — | — | |
| STARE-C2Scenario=Long CoT, Backbone Model=Qwen3-8B-Base, Model Scale=8B2026.06 | 91.2 | — | — | — | — | |
| EAPOScenario=Long CoT, Backbone Model=DeepSeek-R1-Distill-Qwen-1.5B, Model Scale=1.5B2026.06 | 91.1 | — | — | — | — | |
| ReQAT_TQBit-Precision=NVFP4 W4A4KV4, Total fine-tuning tokens=350M2026.06 | 90.72 | — | — | — | — | |
| TLMREbackbone=DeepSeek-R1-Distill-Qwen-7B, alpha=0.22026.05 | 90.7 | 2,312 | — | — | — | |
| Qwen3-Base-GRPOSize=8B2026.06 | 90.7 | — | — | — | — | |
| STARE-C2Scenario=Short CoT, Backbone Model=Qwen2.5-32B-Base, Model Scale=32B2026.06 | 90.6 | — | — | — | — | |
| STARE-O1Scenario=Long CoT, Backbone Model=Qwen3-8B-Base, Model Scale=8B2026.06 | 90.6 | — | — | — | — | |
| ReQAT_TQSBit-Precision=NVFP4 W4A4KV4, Total fine-tuning tokens=350M2026.06 | 90.53 | — | — | — | — | |
| SRQ-driven steeringBackbone=R1-Distill-Qwen-7B, Steering Mechanism=Conceptor2026.04 | 90.4 | — | — | — | — | |
| SRQ-driven steeringBackbone=R1-Distill-Qwen-7B, Steering Mechanism=PCA-CAA2026.04 | 90.4 | — | — | — | — | |
| L1-Maxbackbone=DeepSeek-R1-Distill-Qwen-7B2026.05 | 90.4 | 2,134 | — | — | — | |
| STARE-O1Scenario=Short CoT, Backbone Model=Qwen2.5-32B-Base, Model Scale=32B2026.06 | 90.4 | — | — | — | — | |
| STARE-O1Scenario=Long CoT, Backbone Model=DeepSeek-R1-Distill-Qwen-1.5B, Model Scale=1.5B2026.06 | 90.4 | — | — | — | — | |
| STAPOScenario=Long CoT, Backbone Model=Qwen3-8B-Base, Model Scale=8B2026.06 | 90.4 | — | — | — | — | |
| EntroAdvScenario=Long CoT, Backbone Model=DeepSeek-R1-Distill-Qwen-1.5B, Model Scale=1.5B2026.06 | 90.2 | — | — | — | — | |
| Qwen3-Inst (ReAct)Size=4B2026.06 | 90.1 | — | — | — | — | |
| Qwen3-Base-PPOSize=8B2026.06 | 90.1 | — | — | — | — | |
| Qwen3-BaseSize=14B2026.06 | 90.1 | — | — | — | — | |
| SRQ-driven steeringBackbone=R1-Distill-Qwen-7B, Steering Mechanism=CAA2026.04 | 90 | — | — | — | — | |
| BaselineBit-Precision=BF16, Total fine-tuning tokens=02026.06 | 90 | — | — | — | — | |
| Lp-RegScenario=Short CoT, Backbone Model=Qwen2.5-32B-Base, Model Scale=32B2026.06 | 90 | — | — | — | — | |
| KL-CovScenario=Long CoT, Backbone Model=DeepSeek-R1-Distill-Qwen-1.5B, Model Scale=1.5B2026.06 | 90 | — | — | — | — | |
| DAPOScenario=Long CoT, Backbone Model=DeepSeek-R1-Distill-Qwen-1.5B, Model Scale=1.5B2026.06 | 89.9 | — | — | — | — | |
| 80/20 RuleScenario=Long CoT, Backbone Model=Qwen3-8B-Base, Model Scale=8B2026.06 | 89.9 | — | — | — | — | |
| PCA-CAABackbone=R1-Distill-Qwen-7B2026.04 | 89.8 | — | — | — | — | |
| LC-R1backbone=DeepSeek-R1-Distill-Qwen-7B2026.05 | 89.8 | 1,583 | — | — | — | |
| ReQAT_TBit-Precision=NVFP4 W4A4KV4, Total fine-tuning tokens=350M2026.06 | 89.8 | — | — | — | — | |
| ConceptorBackbone=R1-Distill-Qwen-7B2026.04 | 89.6 | — | — | — | — | |
| SWA8k-RL-900Training Stage=RL, RL Steps=900, Attention Architecture=Sliding Window Attention, Sliding Window Size=8k, T_Train=337, T_Eval=2.112026.06 | 89.4 | — | — | — | — | |
| SWA4k-RL-1400Training Stage=RL, RL Steps=1400, RL Training Budget=~500 GPU Hours, Attention Architecture=Sliding Window Attention, Sliding Window Size=4k, T_Train=474, T_Eval=1.872026.06 | 89.4 | — | — | — | — | |
| 80/20 RuleScenario=Short CoT, Backbone Model=Qwen2.5-32B-Base, Model Scale=32B2026.06 | 89.4 | — | — | — | — | |
| SWA8k-RL-1200Training Stage=RL, RL Steps=1200, RL Training Budget=~500 GPU Hours, Attention Architecture=Sliding Window Attention, Sliding Window Size=8k, T_Train=466, T_Eval=2.232026.06 | 89.3 | — | — | — | — | |
| CAABackbone=R1-Distill-Qwen-7B2026.04 | 89.2 | — | — | — | — | |
| SA-RL-900Training Stage=RL, RL Steps=900, Attention Architecture=Standard Attention, T_Train=498, T_Eval=2.812026.06 | 89.1 | — | — | — | — | |
| GRPOScenario=Long CoT, Backbone Model=DeepSeek-R1-Distill-Qwen-1.5B, Model Scale=1.5B2026.06 | 88.9 | — | — | — | — | |
| GRPOScenario=Long CoT, Backbone Model=Qwen3-8B-Base, Model Scale=8B2026.06 | 88.9 | — | — | — | — | |
| Base LLMBackbone=R1-Distill-Qwen-7B2026.04 | 88.6 | — | — | — | — | |
| Qwen3-BaseSize=32B2026.06 | 88.6 | — | — | — | — | |
| SWA4k-RL-900Training Stage=RL, RL Steps=900, Attention Architecture=Sliding Window Attention, Sliding Window Size=4k, T_Train=285, T_Eval=1.842026.06 | 88.6 | — | — | — | — | |
| GRPO-dsScenario=Long CoT, Backbone Model=Qwen3-8B-Base, Model Scale=8B2026.06 | 88.6 | — | — | — | — | |
| FT + PTQBit-Precision=NVFP4 W4A4KV4, Total fine-tuning tokens=350M2026.06 | 88.53 | — | — | — | — | |
| SWA2k-RL-1700Training Stage=RL, RL Steps=1700, RL Training Budget=~500 GPU Hours, Attention Architecture=Sliding Window Attention, Sliding Window Size=2k, T_Train=470, T_Eval=1.332026.06 | 88.5 | — | — | — | — | |
| SimpleTIRScenario=Tool-Use Agent, Backbone Model=Qwen2.5-7B-Base, Model Scale=7B2026.06 | 88.4 | — | — | — | — | |
| GRPO-dsScenario=Long CoT, Backbone Model=DeepSeek-R1-Distill-Qwen-1.5B, Model Scale=1.5B2026.06 | 88.3 | — | — | — | — | |
| Qwen3-Inst (SC@64)Size=4B2026.06 | 88.2 | — | — | — | — | |
| SRQ-driven steeringBackbone=R1-Distill-Llama-8B, Steering Mechanism=PCA-CAA2026.04 | 87.9 | — | — | — | — | |
| Qwen3-Inst (ToT)Size=4B2026.06 | 87.9 | — | — | — | — | |
| GSPOScenario=Short CoT, Backbone Model=Qwen2.5-32B-Base, Model Scale=32B2026.06 | 87.6 | — | — | — | — | |
| DAPOScenario=Short CoT, Backbone Model=Qwen2.5-32B-Base, Model Scale=32B2026.06 | 87.6 | — | — | — | — | |
| W-REINFScenario=Long CoT, Backbone Model=DeepSeek-R1-Distill-Qwen-1.5B, Model Scale=1.5B2026.06 | 87.5 | — | — | — | — | |
| SRQ-driven steeringBackbone=R1-Distill-Llama-8B, Steering Mechanism=Conceptor2026.04 | 87.4 | — | — | — | — | |
| Lp-RegScenario=Long CoT, Backbone Model=Qwen3-8B-Base, Model Scale=8B2026.06 | 87.4 | — | — | — | — | |
| STARE-C2Scenario=Tool-Use Agent, Backbone Model=Qwen2.5-7B-Base, Model Scale=7B2026.06 | 87.2 | — | — | — | — | |
| PCA-CAABackbone=R1-Distill-Llama-8B2026.04 | 87.1 | — | — | — | — | |
| SWA2k-RL-900Training Stage=RL, RL Steps=900, Attention Architecture=Sliding Window Attention, Sliding Window Size=2k, T_Train=225, T_Eval=1.462026.06 | 87.1 | — | — | — | — | |
| SRQ-driven steeringBackbone=R1-Distill-Llama-8B, Steering Mechanism=CAA2026.04 | 87 | — | — | — | — | |
| EntroRegScenario=Long CoT, Backbone Model=DeepSeek-R1-Distill-Qwen-1.5B, Model Scale=1.5B2026.06 | 86.8 | — | — | — | — | |
| STARE-O1Scenario=Tool-Use Agent, Backbone Model=Qwen2.5-7B-Base, Model Scale=7B2026.06 | 86.8 | — | — | — | — | |
| GRPOScenario=Short CoT, Backbone Model=Qwen2.5-32B-Base, Model Scale=32B2026.06 | 86.6 | — | — | — | — | |
| ConceptorBackbone=R1-Distill-Llama-8B2026.04 | 86.5 | — | — | — | — | |
| Effective TIRScenario=Tool-Use Agent, Backbone Model=Qwen2.5-7B-Base, Model Scale=7B2026.06 | 86.4 | — | — | — | — |