Mathematical Reasoning on AIME 25 (Pass@1, Pass@128)
83Pass@1EvoEnv
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| EvoEnvBase Model=Qwen3-4B-Thinking-25072026.05 | 83 | — | |
| R-ZeroBase Model=Qwen3-4B-Thinking-25072026.05 | 80.6 | — | |
| UntrainedBase Model=Qwen3-4B-Thinking-25072026.05 | 78.8 | — | |
| RLVEBase Model=Qwen3-4B-Thinking-25072026.05 | 75 | — | |
| EvoEnvBase Model=Nemotron-Cascade-8B2026.05 | 72.3 | — | |
| R-ZeroBase Model=Nemotron-Cascade-8B2026.05 | 71.5 | — | |
| UntrainedBase Model=Nemotron-Cascade-8B2026.05 | 71.3 | — | |
| RLVEBase Model=Nemotron-Cascade-8B2026.05 | 69.4 | — | |
| DAPOBase Model=Qwen3-4B-Thinking-25072026.05 | 65.4 | — | |
| DAPOBase Model=Nemotron-Cascade-8B2026.05 | 63.5 | — | |
| EvoEnvBase Model=Qwen3-4B-Instruct-25072026.05 | 52.5 | — | |
| DAPOBase Model=Qwen3-4B-Instruct-25072026.05 | 44.8 | — | |
| RLVEBase Model=Qwen3-4B-Instruct-25072026.05 | 44.3 | — | |
| UntrainedBase Model=Qwen3-4B-Instruct-25072026.05 | 44 | — | |
| R-ZeroBase Model=Qwen3-4B-Instruct-25072026.05 | 43.3 | — | |
| OXAMLEModel Backbone=Qwen2.5-7B-Math, RLVR Stage=After RLVR (†)2026.03 | 42 | 93.3 | |
| OXAFullModel Backbone=Qwen2.5-7B-Math, RLVR Stage=After RLVR (†)2026.03 | 40.8 | 80 | |
| OXAMLEModel Backbone=Qwen2.5-7B-Math, RLVR Stage=Before RLVR2026.03 | 39.3 | 83.3 | |
| Base modelModel=7B2026.06 | 37.5 | — | |
| LoRAModel=7B2026.06 | 37.34 | — | |
| OXAFullModel Backbone=Qwen2.5-7B-Math, RLVR Stage=Before RLVR2026.03 | 36.7 | 83.3 | |
| LoRA (10× LR)Model=7B2026.06 | 36.51 | — | |
| LoRA-αModel=7B2026.06 | 35.62 | — | |
| SFTModel Backbone=Qwen2.5-7B-Math, RLVR Stage=After RLVR (†)2026.03 | 35.1 | 80 | |
| SFTModel Backbone=Qwen2.5-7B-Math, RLVR Stage=Before RLVR2026.03 | 34.2 | 80 | |
| SFTLPModel Backbone=Qwen2.5-7B-Math, RLVR Stage=After RLVR (†)2026.03 | 31.6 | 66.7 | |
| OXAFullModel Backbone=Qwen2.5-1.5B-Math, RLVR Stage=After RLVR (†)2026.03 | 29.3 | 63.3 | |
| SFTLPModel Backbone=Qwen2.5-7B-Math, RLVR Stage=Before RLVR2026.03 | 29 | 63.3 | |
| OXAMLEModel Backbone=Qwen2.5-1.5B-Math, RLVR Stage=After RLVR (†)2026.03 | 27.9 | 63.3 | |
| OXAMLEModel Backbone=Qwen2.5-1.5B-Math, RLVR Stage=Before RLVR2026.03 | 27.1 | 66.7 | |
| OXAFullModel Backbone=Qwen2.5-1.5B-Math, RLVR Stage=Before RLVR2026.03 | 26.7 | 66.7 | |
| SFTModel Backbone=Qwen2.5-1.5B-Math, RLVR Stage=After RLVR (†)2026.03 | 25.4 | 60 | |
| SFTModel Backbone=Qwen2.5-1.5B-Math, RLVR Stage=Before RLVR2026.03 | 23.8 | 60 | |
| LoRA-αModel=1.5B2026.06 | 22.81 | — | |
| SFTLPModel Backbone=Qwen2.5-1.5B-Math, RLVR Stage=After RLVR (†)2026.03 | 22.6 | 60 | |
| Full Fine-TuningModel=1.5B2026.06 | 22.5 | — | |
| SFTLPModel Backbone=Qwen2.5-1.5B-Math, RLVR Stage=Before RLVR2026.03 | 20.5 | 53.3 | |
| Full Fine-TuningModel=7B2026.06 | 16.67 | — | |
| Base modelModel=1.5B2026.06 | 13.33 | — | |
| LoRA (10× LR)Model=1.5B2026.06 | 10 | — | |
| BaseModel Backbone=Qwen2.5-7B-Math, RLVR Stage=Before RLVR2026.03 | 7.3 | 43.3 | |
| LoRAModel=1.5B2026.06 | 6.67 | — | |
| BaseModel Backbone=Qwen2.5-1.5B-Math, RLVR Stage=Before RLVR2026.03 | 4.5 | 36.7 |