Mathematical Reasoning on AIME 24 (Acc, Think Tok.)
10,163Thinking TokensDRE
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| DREBase Model=Qwen3-8B2026.06 | 10,163 | 75.83 | |
| DREBase Model=Qwen3-30B-A3B-Thinking-25072026.06 | 10,407 | 88.54 | |
| GRPO + LPBase Model=Qwen3-8B2026.06 | 12,968 | 74.17 | |
| DREBase Model=Qwen3-4B-Thinking-25072026.06 | 13,092 | 81.87 | |
| GRPOBase Model=Qwen3-8B2026.06 | 13,773 | 75.62 | |
| GRPOBase Model=Qwen3-30B-A3B-Thinking-25072026.06 | 13,784 | 88.75 | |
| Raw ModelBase Model=Qwen3-8B2026.06 | 13,988 | 75.42 | |
| GRPO + LPBase Model=Qwen3-30B-A3B-Thinking-25072026.06 | 14,374 | 88.96 | |
| Raw ModelBase Model=Qwen3-30B-A3B-Thinking-25072026.06 | 15,299 | 88.12 | |
| S-GRPOBase Model=Qwen3-30B-A3B-Thinking-25072026.06 | 15,821 | 88.33 | |
| S-GRPOBase Model=Qwen3-8B2026.06 | 16,133 | 74.17 | |
| GRPOBase Model=Qwen3-4B-Thinking-25072026.06 | 18,322 | 81.17 | |
| Raw ModelBase Model=Qwen3-4B-Thinking-25072026.06 | 18,923 | 81.87 | |
| GRPO + LPBase Model=Qwen3-4B-Thinking-25072026.06 | 19,323 | 79.5 | |
| S-GRPOBase Model=Qwen3-4B-Thinking-25072026.06 | 19,797 | 80 |