Mathematical Reasoning on AIME 2026 (Accuracy, Avg)
38.12AccuracyCERO
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| CEROBackbone=Qwen3-4B-Instruct, Training Algorithm=CERO2026.06 | 38.12 | 0.5011 | |
| GRPOBackbone=Qwen3-4B-Instruct, Training Algorithm=GRPO2026.06 | 36.87 | 0.4683 | |
| CEROBackbone=Qwen3-4B-base, Training Algorithm=CERO2026.06 | 18.12 | 0.2845 | |
| GRPOBackbone=Qwen2.5-Math-7B, Training Algorithm=GRPO2026.06 | 12.5 | 0.2913 | |
| CEROBackbone=R1-Distill-1.5B, Training Algorithm=CERO2026.06 | 12.08 | 0.2684 | |
| CEROBackbone=Qwen2.5-Math-7B, Training Algorithm=CERO2026.06 | 11.87 | 0.3066 | |
| GRPOBackbone=Qwen3-4B-base, Training Algorithm=GRPO2026.06 | 11.04 | 0.2241 | |
| GRPOBackbone=R1-Distill-1.5B, Training Algorithm=GRPO2026.06 | 8.75 | 0.22 |