Mathematical Reasoning on Olympiad (pass@1)
69.8Pass@1GRPO
Evaluation Results
| Method | Links | |
|---|---|---|
| GRPOtraining_data=SuperGPQA subset (11k)2026.02 | 69.8 | |
| Qwen3-8Btraining_data=SuperGPQA subset (11k)2026.02 | 69.2 | |
| LUFFYtraining_data=SuperGPQA subset (11k)2026.02 | 68.7 | |
| RePOtraining_data=SuperGPQA subset (11k)2026.02 | 68.1 | |
| MinPROModel Scale=14B-Base, Off-policyness=Large, Generations per prompt=22026.01 | 58.8 | |
| Thinker-7BModel Scale=7B2026.01 | 58.62 | |
| R³-7BModel Scale=7B2026.01 | 58.44 | |
| CISPOModel Scale=14B-Base, Off-policyness=Large, Generations per prompt=22026.01 | 58 | |
| M2POModel Scale=14B-Base, Off-policyness=Large, Generations per prompt=22026.01 | 57.3 | |
| M2POModel Scale=8B-Base, Off-policyness=Large, Generations per prompt=22026.01 | 56.5 | |
| MinPROModel Scale=8B-Base, Off-policyness=Large, Generations per prompt=22026.01 | 56.5 | |
| SATURN-7BModel Scale=7B2026.01 | 55.6 | |
| R³-1.5BModel Scale=1.5B2026.01 | 54.64 | |
| GSPOModel Scale=14B-Base, Off-policyness=Large, Generations per prompt=22026.01 | 54.6 | |
| DeepSeek-R1-Distill-Qwen-7BModel Scale=7B2026.01 | 54.55 | |
| CISPOModel Scale=8B-Base, Off-policyness=Large, Generations per prompt=22026.01 | 54.3 | |
| LENS_GRPOBase Model=Qwen3-8B-Base2026.01 | 53.33 | |
| FASTCURL-1.5B-V2Model Scale=1.5B2026.01 | 53.28 | |
| LENS_GRPOBase Model=Qwen3-4B-Base2026.01 | 50.37 | |
| DeepScaleR-1.5B-PreviewModel Scale=1.5B2026.01 | 50.18 | |
| GRPOModel Scale=14B-Base, Off-policyness=Large, Generations per prompt=22026.01 | 47.8 | |
| Rstar-Math-7BModel Scale=7B2026.01 | 47.11 | |
| STILL-3-1.5BModel Scale=1.5B2026.01 | 45.32 | |
| GSPOModel Scale=8B-Base, Off-policyness=Large, Generations per prompt=22026.01 | 44.4 | |
| SimpleRL-7BModel Scale=7B2026.01 | 43.4 | |
| Eurus-2-7B-PrimeModel Scale=7B2026.01 | 42.1 | |
| DeepSeek-R1-Distill-Qwen-1.5BModel Scale=1.5B2026.01 | 41.59 | |
| Qwen3-8B-BaseBase Model=Qwen3-8B-Base2026.01 | 41.19 | |
| GRESObackbone=Qwen2.5-7B2026.01 | 40.89 | |
| LENSbackbone=Qwen2.5-7B2026.01 | 40.89 | |
| Qwen2.5-Math-7B-InstructModel Scale=7B2026.01 | 40.69 | |
| GRPOModel Scale=8B-Base, Off-policyness=Large, Generations per prompt=22026.01 | 40.4 | |
| GRPObackbone=Qwen2.5-7B2026.01 | 39.85 | |
| DAPObackbone=Qwen2.5-7B2026.01 | 39.41 | |
| RePOTraining Set=OpenR1-Math Hard Subset2026.02 | 39.1 | |
| Qwen3-4B-BaseBase Model=Qwen3-4B-Base2026.01 | 38.96 | |
| GRPOextendedbackbone=Qwen2.5-7B2026.01 | 38.96 | |
| BaseModel Scale=14B-Base, Off-policyness=Large, Generations per prompt=22026.01 | 35.6 | |
| GRESObackbone=Qwen2.5-3B2026.01 | 32 | |
| LENSbackbone=Qwen2.5-3B2026.01 | 29.78 | |
| DAPObackbone=Qwen2.5-3B2026.01 | 29.48 | |
| Qwen2.5-7Bbackbone=Qwen2.5-7B2026.01 | 29.48 | |
| GRPObackbone=Qwen2.5-3B2026.01 | 27.26 | |
| GRPOextendedbackbone=Qwen2.5-3B2026.01 | 26.81 | |
| Qwen2.5-3Bbackbone=Qwen2.5-3B2026.01 | 25.33 | |
| LENS_GRPOBase Model=Llama3.2-3B-Instruct2026.01 | 21.04 | |
| BaseModel Scale=8B-Base, Off-policyness=Large, Generations per prompt=22026.01 | 20.2 | |
| Qwen2.5-Math-7BTraining Set=OpenR1-Math Hard Subset2026.02 | 15.6 | |
| Llama3.2-3B-InstructBase Model=Llama3.2-3B-Instruct2026.01 | 15.26 | |
| LUFFYTraining Set=OpenR1-Math Hard Subset2026.02 | 0 |