Mathematical Reasoning on AIME 2024 (Accuracy, Avg)
40AccuracyCERO
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| CEROBackbone=Qwen3-4B-Instruct, Training Algorithm=CERO2026.06 | 40 | 50.11 | |
| GRPOBackbone=Qwen3-4B-Instruct, Training Algorithm=GRPO2026.06 | 32.08 | 46.83 | |
| CEROBackbone=Qwen2.5-Math-7B, Training Algorithm=CERO2026.06 | 26.25 | 30.66 | |
| GRPOBackbone=Qwen2.5-Math-7B, Training Algorithm=GRPO2026.06 | 23.96 | 29.13 | |
| CEROBackbone=Qwen3-4B-base, Training Algorithm=CERO2026.06 | 18.75 | 28.45 | |
| CEROBackbone=R1-Distill-1.5B, Training Algorithm=CERO2026.06 | 15.2 | 26.84 | |
| GRPOBackbone=Qwen3-4B-base, Training Algorithm=GRPO2026.06 | 15 | 22.41 | |
| GRPOBackbone=R1-Distill-1.5B, Training Algorithm=GRPO2026.06 | 10.41 | 22 |