Mathematical Reasoning on AIME 2025 (Mean@64 accuracy)
51.2Mean@64 AccAgentic Proposing
Evaluation Results
| Method | Links | |
|---|---|---|
| Agentic Proposingtraining budget=10,000-trajectory, recipe=GRPO, backbone=Qwen3-4B-Instruct-25072026.02 | 51.2 | |
| PromptCot 2.0training budget=10,000-trajectory, recipe=GRPO, backbone=Qwen3-4B-Instruct-25072026.02 | 48.5 | |
| Deepmathtraining budget=10,000-trajectory, recipe=GRPO, backbone=Qwen3-4B-Instruct-25072026.02 | 48.2 | |
| Polaristraining budget=10,000-trajectory, recipe=GRPO, backbone=Qwen3-4B-Instruct-25072026.02 | 47.4 | |
| PromptCoTtraining budget=10,000-trajectory, recipe=GRPO, backbone=Qwen3-4B-Instruct-25072026.02 | 47.3 | |
| MathSmithtraining budget=10,000-trajectory, recipe=GRPO, backbone=Qwen3-4B-Instruct-25072026.02 | 47.1 | |
| Socratic-zerotraining budget=10,000-trajectory, recipe=GRPO, backbone=Qwen3-4B-Instruct-25072026.02 | 46.9 | |
| Qwen3-4B-Instruct-2507mode=zero-shot2026.02 | 46.7 | |
| OpenthoughtsS3training budget=10,000-trajectory, recipe=GRPO, backbone=Qwen3-4B-Instruct-25072026.02 | 46.1 | |
| OpenR1mathtraining budget=10,000-trajectory, recipe=GRPO, backbone=Qwen3-4B-Instruct-25072026.02 | 45.8 | |
| GPT-5.2-Hightraining budget=10,000-trajectory, recipe=GRPO, backbone=Qwen3-4B-Instruct-25072026.02 | 45.8 | |
| Claude4.5-Opustraining budget=10,000-trajectory, recipe=GRPO, backbone=Qwen3-4B-Instruct-25072026.02 | 45.7 | |
| DeepSeek-V3.2-Spetraining budget=10,000-trajectory, recipe=GRPO, backbone=Qwen3-4B-Instruct-25072026.02 | 45.6 | |
| R-zerotraining budget=10,000-trajectory, recipe=GRPO, backbone=Qwen3-4B-Instruct-25072026.02 | 44.3 | |
| Wizardmathtraining budget=10,000-trajectory, recipe=GRPO, backbone=Qwen3-4B-Instruct-25072026.02 | 44 | |
| NuminaMathtraining budget=10,000-trajectory, recipe=GRPO, backbone=Qwen3-4B-Instruct-25072026.02 | 43.9 | |
| Metamathtraining budget=10,000-trajectory, recipe=GRPO, backbone=Qwen3-4B-Instruct-25072026.02 | 43.5 | |
| Qwen3-Maxtraining budget=10,000-trajectory, recipe=GRPO, backbone=Qwen3-4B-Instruct-25072026.02 | 43.4 | |
| Gemini-3-Protraining budget=10,000-trajectory, recipe=GRPO, backbone=Qwen3-4B-Instruct-25072026.02 | 43.1 |