Mathematical Reasoning on AMO-Bench
11.8Mean@64 AccuracyAgentic Proposing
Evaluation Results
| Method | Links | |
|---|---|---|
| Agentic Proposingtraining budget=10,000-trajectory, recipe=GRPO, backbone=Qwen3-4B-Instruct-25072026.02 | 11.8 | |
| Deepmathtraining budget=10,000-trajectory, recipe=GRPO, backbone=Qwen3-4B-Instruct-25072026.02 | 10.3 | |
| PromptCot 2.0training budget=10,000-trajectory, recipe=GRPO, backbone=Qwen3-4B-Instruct-25072026.02 | 10.2 | |
| Polaristraining budget=10,000-trajectory, recipe=GRPO, backbone=Qwen3-4B-Instruct-25072026.02 | 9.8 | |
| Qwen3-4B-Instruct-2507mode=zero-shot2026.02 | 9.3 | |
| PromptCoTtraining budget=10,000-trajectory, recipe=GRPO, backbone=Qwen3-4B-Instruct-25072026.02 | 9.1 | |
| MathSmithtraining budget=10,000-trajectory, recipe=GRPO, backbone=Qwen3-4B-Instruct-25072026.02 | 9.1 | |
| Socratic-zerotraining budget=10,000-trajectory, recipe=GRPO, backbone=Qwen3-4B-Instruct-25072026.02 | 9.1 | |
| OpenR1mathtraining budget=10,000-trajectory, recipe=GRPO, backbone=Qwen3-4B-Instruct-25072026.02 | 8.9 | |
| DeepSeek-V3.2-Spetraining budget=10,000-trajectory, recipe=GRPO, backbone=Qwen3-4B-Instruct-25072026.02 | 8.8 | |
| Qwen3-Maxtraining budget=10,000-trajectory, recipe=GRPO, backbone=Qwen3-4B-Instruct-25072026.02 | 8.5 | |
| OpenthoughtsS3training budget=10,000-trajectory, recipe=GRPO, backbone=Qwen3-4B-Instruct-25072026.02 | 8.4 | |
| NuminaMathtraining budget=10,000-trajectory, recipe=GRPO, backbone=Qwen3-4B-Instruct-25072026.02 | 8.2 | |
| Gemini-3-Protraining budget=10,000-trajectory, recipe=GRPO, backbone=Qwen3-4B-Instruct-25072026.02 | 8.1 | |
| Metamathtraining budget=10,000-trajectory, recipe=GRPO, backbone=Qwen3-4B-Instruct-25072026.02 | 7.8 | |
| GPT-5.2-Hightraining budget=10,000-trajectory, recipe=GRPO, backbone=Qwen3-4B-Instruct-25072026.02 | 7.8 | |
| Wizardmathtraining budget=10,000-trajectory, recipe=GRPO, backbone=Qwen3-4B-Instruct-25072026.02 | 7.6 | |
| Claude4.5-Opustraining budget=10,000-trajectory, recipe=GRPO, backbone=Qwen3-4B-Instruct-25072026.02 | 7.4 | |
| R-zerotraining budget=10,000-trajectory, recipe=GRPO, backbone=Qwen3-4B-Instruct-25072026.02 | 6.7 | |
| DynamicBackbone=Llama-3.1-8B2026.02 | 4 | |
| Dynamic + PRM SelectionBackbone=Llama-3.1-8B2026.02 | 4 | |
| DynamicBackbone=Qwen-2.5-7B2026.02 | 4 | |
| Dynamic + PRM SelectionBackbone=Qwen-2.5-7B2026.02 | 4 | |
| DirectBackbone=Llama-3.1-8B2026.02 | 2 | |
| Direct + PRM SelectionBackbone=Llama-3.1-8B2026.02 | 2 | |
| DirectBackbone=Qwen-2.5-7B2026.02 | 2 | |
| Direct + PRM SelectionBackbone=Qwen-2.5-7B2026.02 | 2 |