Mathematical Reasoning on HMMT February
0.4667Mean@64 AccSPS
Evaluation Results
| Method | Links | |
|---|---|---|
| SPSBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.04 | 0.4667 | |
| GRPOBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.04 | 0.4 | |
| Agentic Proposingtraining budget=10,000-trajectory, recipe=GRPO, backbone=Qwen3-4B-Instruct-25072026.02 | 0.365 | |
| PromptCot 2.0training budget=10,000-trajectory, recipe=GRPO, backbone=Qwen3-4B-Instruct-25072026.02 | 0.342 | |
| Polaristraining budget=10,000-trajectory, recipe=GRPO, backbone=Qwen3-4B-Instruct-25072026.02 | 0.338 | |
| Deepmathtraining budget=10,000-trajectory, recipe=GRPO, backbone=Qwen3-4B-Instruct-25072026.02 | 0.337 | |
| DeepSeek-R1-Distill-Qwen-1.5BType=Base Model2026.04 | 0.3333 | |
| DAPOBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.04 | 0.3333 | |
| PromptCoTtraining budget=10,000-trajectory, recipe=GRPO, backbone=Qwen3-4B-Instruct-25072026.02 | 0.331 | |
| MathSmithtraining budget=10,000-trajectory, recipe=GRPO, backbone=Qwen3-4B-Instruct-25072026.02 | 0.329 | |
| OpenR1mathtraining budget=10,000-trajectory, recipe=GRPO, backbone=Qwen3-4B-Instruct-25072026.02 | 0.318 | |
| Socratic-zerotraining budget=10,000-trajectory, recipe=GRPO, backbone=Qwen3-4B-Instruct-25072026.02 | 0.313 | |
| DeepSeek-V3.2-Spetraining budget=10,000-trajectory, recipe=GRPO, backbone=Qwen3-4B-Instruct-25072026.02 | 0.312 | |
| Qwen3-4B-Instruct-2507mode=zero-shot2026.02 | 0.31 | |
| Claude4.5-Opustraining budget=10,000-trajectory, recipe=GRPO, backbone=Qwen3-4B-Instruct-25072026.02 | 0.308 | |
| OpenthoughtsS3training budget=10,000-trajectory, recipe=GRPO, backbone=Qwen3-4B-Instruct-25072026.02 | 0.306 | |
| Qwen3-Maxtraining budget=10,000-trajectory, recipe=GRPO, backbone=Qwen3-4B-Instruct-25072026.02 | 0.302 | |
| R-zerotraining budget=10,000-trajectory, recipe=GRPO, backbone=Qwen3-4B-Instruct-25072026.02 | 0.301 | |
| GSPOBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.04 | 0.3 | |
| GPT-5.2-Hightraining budget=10,000-trajectory, recipe=GRPO, backbone=Qwen3-4B-Instruct-25072026.02 | 0.299 | |
| NuminaMathtraining budget=10,000-trajectory, recipe=GRPO, backbone=Qwen3-4B-Instruct-25072026.02 | 0.291 | |
| Gemini-3-Protraining budget=10,000-trajectory, recipe=GRPO, backbone=Qwen3-4B-Instruct-25072026.02 | 0.287 | |
| Wizardmathtraining budget=10,000-trajectory, recipe=GRPO, backbone=Qwen3-4B-Instruct-25072026.02 | 0.278 | |
| Metamathtraining budget=10,000-trajectory, recipe=GRPO, backbone=Qwen3-4B-Instruct-25072026.02 | 0.274 |