Mathematical Reasoning on AIME 2025 (Accuracy and Tokens)
69.7AccuracyGRPO
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| GRPOModel=Qwen3-14B2026.06 | 69.7 | 16,689 | |
| ThoughtFoldModel=Qwen3-14B2026.06 | 69.7 | 11,217 | |
| VanillaModel=Qwen3-14B2026.06 | 69.2 | 16,978 | |
| GRPOModel=Qwen3-8B2026.06 | 65.4 | 17,987 | |
| ThoughtFoldModel=Qwen3-8B2026.06 | 65.4 | 11,670 | |
| VanillaModel=Qwen3-8B2026.06 | 65.2 | 18,401 | |
| Short-RLModel=Qwen3-14B2026.06 | 63.1 | 11,392 | |
| RL + Length PenaltyModel=Qwen3-14B2026.06 | 61.5 | 11,376 | |
| Short-RLModel=Qwen3-8B2026.06 | 60.9 | 10,937 | |
| RL + Length PenaltyModel=Qwen3-8B2026.06 | 60 | 11,547 | |
| GRPOModel=DeepSeek-R1-Distill-Qwen-14B2026.06 | 47.3 | 13,519 | |
| ThoughtFoldModel=DeepSeek-R1-Distill-Qwen-14B2026.06 | 46.9 | 8,713 | |
| VanillaModel=DeepSeek-R1-Distill-Qwen-14B2026.06 | 46.3 | 13,421 | |
| RL + Length PenaltyModel=DeepSeek-R1-Distill-Qwen-14B2026.06 | 43.2 | 9,289 | |
| Short-RLModel=DeepSeek-R1-Distill-Qwen-14B2026.06 | 42 | 9,279 | |
| VanillaModel=DeepSeek-R1-Distill-Qwen-7B2026.06 | 39.1 | 15,131 | |
| ThoughtFoldModel=DeepSeek-R1-Distill-Qwen-7B2026.06 | 39.1 | 9,102 | |
| GRPOModel=DeepSeek-R1-Distill-Qwen-7B2026.06 | 39 | 14,926 | |
| RL + Length PenaltyModel=DeepSeek-R1-Distill-Qwen-7B2026.06 | 35.5 | 9,976 | |
| Short-RLModel=DeepSeek-R1-Distill-Qwen-7B2026.06 | 35.2 | 9,779 |