Mathematical Reasoning on AIME '24 (Pass@1, Pass@32)
86.7Pass@1 AccuracyUntrained
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| UntrainedBase Model=Qwen3-4B-Thinking-25072026.05 | 86.7 | — | |
| EvoEnvBase Model=Qwen3-4B-Thinking-25072026.05 | 86.2 | — | |
| EvoEnvBase Model=Nemotron-Cascade-8B2026.05 | 84.8 | — | |
| R-ZeroBase Model=Qwen3-4B-Thinking-25072026.05 | 84.2 | — | |
| UntrainedBase Model=Nemotron-Cascade-8B2026.05 | 83.3 | — | |
| R-ZeroBase Model=Nemotron-Cascade-8B2026.05 | 83.3 | — | |
| RLVEBase Model=Qwen3-4B-Thinking-25072026.05 | 81.9 | — | |
| RLVEBase Model=Nemotron-Cascade-8B2026.05 | 79.8 | — | |
| DAPOBase Model=Nemotron-Cascade-8B2026.05 | 78.3 | — | |
| DAPOBase Model=Qwen3-4B-Thinking-25072026.05 | 74 | — | |
| EvoEnvBase Model=Qwen3-4B-Instruct-25072026.05 | 61.9 | — | |
| UntrainedBase Model=Qwen3-4B-Instruct-25072026.05 | 58.8 | — | |
| RLVEBase Model=Qwen3-4B-Instruct-25072026.05 | 57.1 | — | |
| R-ZeroBase Model=Qwen3-4B-Instruct-25072026.05 | 55 | — | |
| DAPOBase Model=Qwen3-4B-Instruct-25072026.05 | 50 | — | |
| ACTMatBase Model=OLMo-3-7B, Setting=RL Zero, Fine-tuning=RLVR2026.04 | 39.9 | 80 | |
| TSVBase Model=OLMo-3-7B, Setting=RL Zero, Fine-tuning=RLVR, Scaling Factor (alpha)=12026.04 | 39.8 | 80 | |
| EXPERTBase Model=OLMo-3-7B, Setting=RL Zero, Fine-tuning=RLVR2026.04 | 38.2 | 76.7 | |
| TABase Model=OLMo-3-7B, Setting=RL Zero, Fine-tuning=RLVR, Scaling Factor (alpha)=0.42026.04 | 36.8 | 73.3 | |
| AVERAGEBase Model=OLMo-3-7B, Setting=RL Zero, Fine-tuning=RLVR2026.04 | 35.9 | 80 | |
| ISO-CBase Model=OLMo-3-7B, Setting=RL Zero, Fine-tuning=RLVR, Scaling Factor (alpha)=12026.04 | 33.4 | 76.7 | |
| REGMEANBase Model=OLMo-3-7B, Setting=RL Zero, Fine-tuning=RLVR2026.04 | 30.8 | 73.3 | |
| ZERO-SHOTBase Model=OLMo-3-7B, Setting=RL Zero, Fine-tuning=RLVR2026.04 | 22.1 | 66.7 |