Mathematical Reasoning on AIME26 (Acc, Think Tok.)
11,381Thinking TokensDRE
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| DREBase Model=Qwen3-8B2026.06 | 11,381 | 66.87 | |
| DREBackbone=Qwen3-8B2026.06 | 11,381 | 66.87 | |
| DREBase Model=Qwen3-30B-A3B-Thinking-25072026.06 | 12,153 | 86.46 | |
| DREBackbone=Qwen3-30B-A3B-Thinking-25072026.06 | 12,153 | 86.46 | |
| DEERBackbone=Qwen3-8B2026.06 | 14,324 | 59.26 | |
| DREBase Model=Qwen3-4B-Thinking-25072026.06 | 14,431 | 79.37 | |
| DREBackbone=Qwen3-4B-Thinking-25072026.06 | 14,431 | 79.37 | |
| RCPDBackbone=Qwen3-8B2026.06 | 14,857 | 62.5 | |
| GRPO + LPBase Model=Qwen3-8B2026.06 | 15,107 | 63.96 | |
| GRPOBase Model=Qwen3-30B-A3B-Thinking-25072026.06 | 15,158 | 84.58 | |
| GRPOBase Model=Qwen3-8B2026.06 | 15,581 | 65.21 | |
| RCPDBackbone=Qwen3-30B-A3B-Thinking-25072026.06 | 15,741 | 85.83 | |
| Raw ModelBase Model=Qwen3-8B2026.06 | 15,862 | 66.67 | |
| Raw ModelBackbone=Qwen3-8B2026.06 | 15,862 | 66.67 | |
| GRPO + LPBase Model=Qwen3-30B-A3B-Thinking-25072026.06 | 16,039 | 85 | |
| RCPDBackbone=Qwen3-4B-Thinking-25072026.06 | 16,916 | 76.04 | |
| Raw ModelBase Model=Qwen3-30B-A3B-Thinking-25072026.06 | 16,985 | 88.96 | |
| Raw ModelBackbone=Qwen3-30B-A3B-Thinking-25072026.06 | 16,985 | 88.96 | |
| S-GRPOBase Model=Qwen3-8B2026.06 | 17,707 | 62.5 | |
| DEERBackbone=Qwen3-30B-A3B-Thinking-25072026.06 | 17,707 | 86.29 | |
| S-GRPOBase Model=Qwen3-30B-A3B-Thinking-25072026.06 | 19,133 | 85 | |
| DEERBackbone=Qwen3-4B-Thinking-25072026.06 | 19,219 | 78.52 | |
| GRPOBase Model=Qwen3-4B-Thinking-25072026.06 | 20,284 | 76.67 | |
| GRPO + LPBase Model=Qwen3-4B-Thinking-25072026.06 | 20,302 | 75.62 | |
| Raw ModelBase Model=Qwen3-4B-Thinking-25072026.06 | 20,789 | 77.71 | |
| Raw ModelBackbone=Qwen3-4B-Thinking-25072026.06 | 20,789 | 77.71 | |
| S-GRPOBase Model=Qwen3-4B-Thinking-25072026.06 | 21,304 | 78.33 |