Mathematical Reasoning on AIME 2024 (AIME24, Math Avg)
93.3AccuracyDC-Tail
Evaluation Results
| Method | Links | |||||||
|---|---|---|---|---|---|---|---|---|
| DC-TailModel=DeepSeek-R1-8B2026.05 | 93.3 | — | — | — | — | — | — | |
| D-CDG (α = 1)Model=DeepSeek-R1-8B2026.05 | 93.3 | — | — | — | — | — | — | |
| CDG (ours)Model=DeepSeek-R1-8B2026.05 | 93.3 | — | — | — | — | — | — | |
| MajorityModel=gpt-oss-20B2026.05 | 93.3 | — | — | — | — | — | — | |
| DC-MeanModel=gpt-oss-20B2026.05 | 93.3 | — | — | — | — | — | — | |
| DC-TailModel=gpt-oss-20B2026.05 | 93.3 | — | — | — | — | — | — | |
| D-CDG (α = 1)Model=gpt-oss-20B2026.05 | 93.3 | — | — | — | — | — | — | |
| D-CDG (β = 0)Model=gpt-oss-20B2026.05 | 93.3 | — | — | — | — | — | — | |
| CDG (ours)Model=gpt-oss-20B2026.05 | 93.3 | — | — | — | — | — | — | |
| RREDCoTGeneration Length=25k tokens, Training Dataset=Numina-CoT2026.06 | 90.8 | — | — | — | — | — | — | |
| MajorityModel=DeepSeek-R1-8B2026.05 | 90 | — | — | — | — | — | — | |
| DC-MeanModel=DeepSeek-R1-8B2026.05 | 90 | — | — | — | — | — | — | |
| D-CDG (β = 0)Model=DeepSeek-R1-8B2026.05 | 90 | — | — | — | — | — | — | |
| DC-MeanModel=QwQ-32B2026.05 | 90 | — | — | — | — | — | — | |
| D-CDG (α = 1)Model=QwQ-32B2026.05 | 90 | — | — | — | — | — | — | |
| D-CDG (β = 0)Model=QwQ-32B2026.05 | 90 | — | — | — | — | — | — | |
| CDG (ours)Model=QwQ-32B2026.05 | 90 | — | — | — | — | — | — | |
| DeepSeek-R1-0528Quantization=FP8-Block-Wise2026.02 | 88.67 | — | — | — | — | — | — | |
| DeepSeek-R1-0528Quantization=W4A8-FP82026.02 | 88.67 | — | — | — | — | — | — | |
| ExCommBackbone=Qwen2.5-7B, N > 1?=true, Available Tools=C2026.05 | 87.8 | — | — | — | — | — | — | |
| Upper BoundModel=Qwen3-8B, k=62025.08 | 87.78 | — | — | — | — | — | — | |
| MajorityModel=QwQ-32B2026.05 | 86.7 | — | — | — | — | — | — | |
| DC-TailModel=QwQ-32B2026.05 | 86.7 | — | — | — | — | — | — | |
| Full AttnAttention Strategy=Full Attention2026.05 | 86.67 | — | — | — | — | — | — | |
| RTPurboselection_strategy=top-p2026.05 | 86.67 | — | — | — | — | — | — | |
| Pass@1Model=DeepSeek-R1-8B2026.05 | 86.5 | — | — | — | — | — | — | |
| GRPOGeneration Length=25k tokens, Training Dataset=Numina-CoT2026.06 | 85 | — | — | — | — | — | — | |
| Independent ScalingBackbone=Qwen2.5-7B, N > 1?=true, Available Tools=C2026.05 | 84.2 | — | — | — | — | — | — | |
| I-DLMParams=32B, Decoding=ISD (N=4, sampling)2026.04 | 83.3 | — | — | — | — | — | — | |
| Independent Scaling + SRBackbone=Qwen2.5-7B, N > 1?=true, Available Tools=C2026.05 | 83.3 | — | — | — | — | — | — | |
| S2: S1 → SFT(2) 60B Targeted (all-attention)Campaign=S2: S1 → SFT(2) 60B Targeted 8 placements, Config=all-attention, @32k speedup=1.0×2026.04 | 82.6 | 93.3 | 91 | — | — | — | — | |
| S1: Distil. 69B (Reg|Lklhd–26)Campaign=S1: Distil. 69B, Config=Reg|Lklhd–26, @32k speedup=2.9×2026.04 | 82.5 | 80 | 89.6 | — | — | — | — | |
| Pass@1Model=QwQ-32B2026.05 | 81.7 | — | — | — | — | — | — | |
| PiCSARModel=Qwen3-8B, k=62025.08 | 81.33 | — | — | — | — | — | — | |
| S1: Distil. 69B (all-attention)Campaign=S1: Distil. 69B, Config=all-attention, @32k speedup=1.0×2026.04 | 80.4 | 90 | 85.6 | — | — | — | — | |
| S2: S1 → SFT(1) 40B Single Placement (Idealized|Lklhd–6)Campaign=S2: S1 → SFT(1) 40B Single Placement, Config=Idealized|Lklhd–6, @32k speedup=6.2×2026.04 | 80.1 | 93.3 | 90.9 | — | — | — | — | |
| SPSBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.04 | 80 | — | — | — | — | — | — | |
| RTPurboselection_strategy=top-k2026.05 | 80 | — | — | — | — | — | — | |
| S1: Distil. 69B (Idealized|All–18)Campaign=S1: Distil. 69B, Config=Idealized|All–18, @32k speedup=2.0×2026.04 | 79.6 | 86.7 | 86.2 | — | — | — | — | |
| Sequential Revision (SR)Backbone=Qwen2.5-7B, N > 1?=false, Available Tools=C2026.05 | 78.6 | — | — | — | — | — | — | |
| Tree SearchBackbone=Qwen2.5-7B, N > 1?=true, Available Tools=C2026.05 | 78.3 | — | — | — | — | — | — | |
| Pass@1Model=gpt-oss-20B2026.05 | 77.9 | — | — | — | — | — | — | |
| Apriel-H1 15BConfig=Hybrid, @32k speedup=2.0×2026.04 | 77.3 | 80 | 80.4 | — | — | — | — | |
| Self-ConsistencyModel=Qwen3-8B, k=62025.08 | 77.23 | — | — | — | — | — | — | |
| S1: Distil. 69B (Idealized|All–7)Campaign=S1: Distil. 69B, Config=Idealized|All–7, @32k speedup=4.3×2026.04 | 77 | 76.7 | 78.4 | — | — | — | — | |
| Base AgentBackbone=Qwen2.5-7B, N > 1?=false, Available Tools=C2026.05 | 76.9 | — | — | — | — | — | — | |
| Qwen3Params=32B2026.04 | 76.7 | — | — | — | — | — | — | |
| S1: Distil. 69B (Idealized|All–6)Campaign=S1: Distil. 69B, Config=Idealized|All–6, @32k speedup=6.1×2026.04 | 76.7 | 63.3 | 76.7 | — | — | — | — | |
| DiffMASModel=Qwen3-8B, Communication Category=Trained Latent Communication2026.04 | 76.7 | — | — | — | — | — | — | |
| Qwen3-4B-Thinking (2507)Parameters=4B, Thinking Mode=true2026.04 | 76.67 | — | — | — | — | — | — | |
| S1: Distil. 69B (Reg|Lklhd–18)Campaign=S1: Distil. 69B, Config=Reg|Lklhd–18, @32k speedup=4.8×2026.04 | 76.5 | 63.3 | 78.1 | — | — | — | — | |
| Falcon-H1R 7BConfig=Hybrid, @32k speedup=4.6×2026.04 | 75.9 | 66.7 | 78.6 | — | — | — | — | |
| AverageModel=Qwen3-8B, k=62025.08 | 75.37 | — | — | — | — | — | — | |
| S1: Distil. 69B (Idealized|Lklhd–6)Campaign=S1: Distil. 69B, Config=Idealized|Lklhd–6, @32k speedup=6.2×2026.04 | 74.2 | 76.7 | 74.2 | — | — | — | — | |
| GSPOBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.04 | 73.33 | — | — | — | — | — | — | |
| Qwen3Params=8B2026.04 | 73.1 | — | — | — | — | — | — | |
| ExCommBackbone=Gemini-2.5-Flash-Lite, N > 1?=true, Available Tools=C2026.05 | 72.5 | — | — | — | — | — | — | |
| Upper BoundModel=DS-Distill-Qwen-2.5-7B, k=62025.08 | 72.22 | — | — | — | — | — | — | |
| GRPOBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.04 | 70 | — | — | — | — | — | — | |
| I-DLMParams=8B, Decoding=ISD (N=4, sampling)2026.04 | 69.6 | — | — | — | — | — | — | |
| Full AttentionBackbone=GPT-OSS2026.04 | 69.2 | — | — | — | — | — | — | |
| Qwen3-4B Instruct 2507 (starting point)Generation Length=25k tokens, Training Dataset=Numina-CoT2026.06 | 69.2 | — | — | — | — | — | — | |
| S1: Distil. 69B (Reg|Lklhd–13)Campaign=S1: Distil. 69B, Config=Reg|Lklhd–13, @32k speedup=6.9×2026.04 | 69 | 66.7 | 76.2 | — | — | — | — | |
| DeepSeek-R1-Distill-Qwen-7Bhint_setting=w/ LLM Hints2026.04 | 68.97 | — | — | — | — | — | — | |
| Qwen3-8B + ReTool-RLBase Model=Qwen3-8B, Training Stage=RL, Framework=ReTool, Augmentation=None2026.06 | 67.5 | — | — | — | — | — | — | |
| Tree SearchBackbone=Gemini-2.5-Flash-Lite, N > 1?=true, Available Tools=C2026.05 | 67.2 | — | — | — | — | — | — | |
| OPDTeacher-Student Pair=DeepSeek-R1-Distill-Qwen-7B / Skywork-OR1-7B, Time=17.5h, Red.=0%2026.05 | 67.1 | — | — | — | — | — | — | |
| PRUNE-OPD (overlap)Teacher-Student Pair=DeepSeek-R1-Distill-Qwen-7B / Skywork-OR1-7B, Time=17.0h, Red.=2.9%2026.05 | 66.7 | — | — | — | — | — | — | |
| DAPOBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.04 | 66.67 | — | — | — | — | — | — | |
| Upper BoundModel=DS-Distill-llama-3-8B, k=62025.08 | 66.67 | — | — | — | — | — | — | |
| OriginalBackbone=Qwen3-8b2025.10 | 66.67 | — | — | — | — | — | — | |
| UCoT-0.9Backbone=Qwen3-8b, Compression Ratio=0.92025.10 | 66.67 | — | — | — | — | — | — | |
| OPD (Truncate 4k)Teacher-Student Pair=DeepSeek-R1-Distill-Qwen-7B / Skywork-OR1-7B, Time=11.3h, Red.=35.4%2026.05 | 66 | — | — | — | — | — | — | |
| Independent ScalingBackbone=Gemini-2.5-Flash-Lite, N > 1?=true, Available Tools=C2026.05 | 65.3 | — | — | — | — | — | — | |
| Independent Scaling + SRBackbone=Gemini-2.5-Flash-Lite, N > 1?=true, Available Tools=C2026.05 | 65.3 | — | — | — | — | — | — | |
| LightThinkerBackbone=Qwen3-8b2025.10 | 63.333 | — | — | — | — | — | — | |
| UCoT-0.7Backbone=Qwen3-8b, Compression Ratio=0.72025.10 | 63.333 | — | — | — | — | — | — | |
| DeepSeek-R1-Distill-Qwen-1.5BType=Base Model2026.04 | 63.33 | — | — | — | — | — | — | |
| DiffMASModel=Qwen3-4B, Communication Category=Trained Latent Communication2026.04 | 63.3 | — | — | — | — | — | — | |
| S1: Distil. 69B (Reg|Lklhd–10)Campaign=S1: Distil. 69B, Config=Reg|Lklhd–10, @32k speedup=10.7×2026.04 | 62.9 | 56.7 | 68 | — | — | — | — | |
| Base AgentBackbone=Gemini-2.5-Flash-Lite, N > 1?=false, Available Tools=C2026.05 | 61.4 | — | — | — | — | — | — | |
| PiCSARModel=DS-Distill-Qwen-2.5-7B, k=62025.08 | 61.11 | — | — | — | — | — | — | |
| Sequential Revision (SR)Backbone=Gemini-2.5-Flash-Lite, N > 1?=false, Available Tools=C2026.05 | 60.3 | — | — | — | — | — | — | |
| TriAttentionBackbone=GPT-OSS2026.04 | 59.2 | — | — | — | — | — | — | |
| Qwen3-8B + ReTool-RL w/ CoBeBase Model=Qwen3-8B, Training Stage=RL, Framework=ReTool, Augmentation=CoBe2026.06 | 58.8 | — | — | — | — | — | — | |
| Full AttentionBackbone=Qwen3-8B2026.04 | 57.1 | — | — | — | — | — | — | |
| LatentMASModel=Qwen3-8B, Communication Category=Training-free Latent Communication2026.04 | 56.7 | — | — | — | — | — | — | |
| D-CDG (α = 1)Model=Gemma-3-27B2026.05 | 56.7 | — | — | — | — | — | — | |
| CDG (ours)Model=Gemma-3-27B2026.05 | 56.7 | — | — | — | — | — | — | |
| CoconutBackbone=Qwen3-8b2025.10 | 56.671 | — | — | — | — | — | — | |
| UCoT-0.5Backbone=Qwen3-8b, Compression Ratio=0.52025.10 | 56.671 | — | — | — | — | — | — | |
| o1-miniParameter Count=>7B2026.05 | 53.3 | — | — | — | — | — | — | |
| DC-TailModel=Gemma-3-27B2026.05 | 53.3 | — | — | — | — | — | — | |
| GCPOBackbone=Qwen3-4B2026.05 | 51.7 | — | — | — | — | — | — | |
| Full AttentionBackbone=DS-Llama2026.04 | 50.4 | — | — | — | — | — | — | |
| Depth-RecurrentBackbone=Qwen3-8b2025.10 | 50.0016 | — | — | — | — | — | — | |
| LatentMASModel=Qwen3-4B, Communication Category=Training-free Latent Communication2026.04 | 50 | — | — | — | — | — | — | |
| SingleModel=Qwen3-8B, Communication Category=Text Communication2026.04 | 50 | — | — | — | — | — | — | |
| TextMASModel=Qwen3-8B, Communication Category=Text Communication2026.04 | 50 | — | — | — | — | — | — | |
| GSPO + TACBackbone=DeepSeek-R1-Distill-Qwen-7B, Training steps=30002025.10 | 50 | — | — | — | — | — | — |