Mathematical Reasoning on AIME 2024 (Mean@64 accuracy)
53.6Mean@64 AccuracyAgentic Proposing
Evaluation Results
| Method | Links | |
|---|---|---|
| Agentic Proposingtraining budget=10,000-trajectory, recipe=GRPO, backbone=Qwen3-4B-Instruct-25072026.02 | 53.6 | |
| Polaristraining budget=10,000-trajectory, recipe=GRPO, backbone=Qwen3-4B-Instruct-25072026.02 | 51.7 | |
| Deepmathtraining budget=10,000-trajectory, recipe=GRPO, backbone=Qwen3-4B-Instruct-25072026.02 | 51.2 | |
| PromptCot 2.0training budget=10,000-trajectory, recipe=GRPO, backbone=Qwen3-4B-Instruct-25072026.02 | 50.9 | |
| MathSmithtraining budget=10,000-trajectory, recipe=GRPO, backbone=Qwen3-4B-Instruct-25072026.02 | 50.3 | |
| Socratic-zerotraining budget=10,000-trajectory, recipe=GRPO, backbone=Qwen3-4B-Instruct-25072026.02 | 50.2 | |
| PromptCoTtraining budget=10,000-trajectory, recipe=GRPO, backbone=Qwen3-4B-Instruct-25072026.02 | 50.1 | |
| Qwen3-4B-Instruct-2507mode=zero-shot2026.02 | 49.8 | |
| OpenthoughtsS3training budget=10,000-trajectory, recipe=GRPO, backbone=Qwen3-4B-Instruct-25072026.02 | 49.6 | |
| DeepSeek-V3.2-Spetraining budget=10,000-trajectory, recipe=GRPO, backbone=Qwen3-4B-Instruct-25072026.02 | 49.5 | |
| OpenR1mathtraining budget=10,000-trajectory, recipe=GRPO, backbone=Qwen3-4B-Instruct-25072026.02 | 49.4 | |
| Claude4.5-Opustraining budget=10,000-trajectory, recipe=GRPO, backbone=Qwen3-4B-Instruct-25072026.02 | 48.3 | |
| GPT-5.2-Hightraining budget=10,000-trajectory, recipe=GRPO, backbone=Qwen3-4B-Instruct-25072026.02 | 47.7 | |
| NuminaMathtraining budget=10,000-trajectory, recipe=GRPO, backbone=Qwen3-4B-Instruct-25072026.02 | 47.3 | |
| Qwen3-Maxtraining budget=10,000-trajectory, recipe=GRPO, backbone=Qwen3-4B-Instruct-25072026.02 | 46.2 | |
| R-zerotraining budget=10,000-trajectory, recipe=GRPO, backbone=Qwen3-4B-Instruct-25072026.02 | 45.8 | |
| Gemini-3-Protraining budget=10,000-trajectory, recipe=GRPO, backbone=Qwen3-4B-Instruct-25072026.02 | 45.5 | |
| Wizardmathtraining budget=10,000-trajectory, recipe=GRPO, backbone=Qwen3-4B-Instruct-25072026.02 | 44.8 | |
| Metamathtraining budget=10,000-trajectory, recipe=GRPO, backbone=Qwen3-4B-Instruct-25072026.02 | 44.6 |