Math Reasoning on AIME 25 (mean@12)
69.7Mean@12 ScoreGRPO
Evaluation Results
| Method | Links | |
|---|---|---|
| GRPOModel=Qwen3-8B2026.06 | 69.7 | |
| RLCSDModel=Qwen3-8B2026.06 | 69.7 | |
| RLCSDModel=Qwen3-4B2026.06 | 69.4 | |
| GRPOModel=Olmo-3-7B2026.06 | 68.9 | |
| OPSDModel=Qwen3-8B2026.06 | 68.7 | |
| RLCSDModel=Olmo-3-7B2026.06 | 68.6 | |
| OPSDModel=Qwen3-4B2026.06 | 67.5 | |
| SDPOModel=Olmo-3-7B2026.06 | 67.4 | |
| RLSDModel=Qwen3-8B2026.06 | 67.2 | |
| RLSDModel=Qwen3-4B2026.06 | 66.9 | |
| BaseModel=Qwen3-8B2026.06 | 66.9 | |
| BaseModel=Olmo-3-7B2026.06 | 66.9 | |
| OPSDModel=Olmo-3-7B2026.06 | 66.9 | |
| RLSDModel=Olmo-3-7B2026.06 | 66.9 | |
| GRPOModel=Qwen3-4B2026.06 | 66.1 | |
| SDPOModel=Qwen3-8B2026.06 | 65.6 | |
| SRPOModel=Qwen3-8B2026.06 | 65.6 | |
| BaseModel=Qwen3-4B2026.06 | 65.3 | |
| SRPOModel=Olmo-3-7B2026.06 | 65.3 | |
| SRPOModel=Qwen3-4B2026.06 | 64.7 | |
| SDPOModel=Qwen3-4B2026.06 | 64.4 | |
| RLCSDModel=Qwen3-1.7B2026.06 | 38.3 | |
| OPSDModel=Qwen3-1.7B2026.06 | 37.7 | |
| GRPOModel=Qwen3-1.7B2026.06 | 37.2 | |
| RLSDModel=Qwen3-1.7B2026.06 | 36.9 | |
| SRPOModel=Qwen3-1.7B2026.06 | 34.4 | |
| SDPOModel=Qwen3-1.7B2026.06 | 33.6 | |
| BaseModel=Qwen3-1.7B2026.06 | 33.3 |