Mathematical Reasoning on AIME 2024 (Pass@1, Pass@32, Avg)
57.29Pass@1FG-ExPO
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| FG-ExPOBackbone=Qwen3-8B-Base2026.05 | 57.29 | 80 | — | |
| GRPOBackbone=Qwen3-8B-Base2026.05 | 54.58 | 80 | — | |
| ISPOBase Model=Qwen2.5-Math-7B, Decoding Strategy=Greedy (T=0)2026.06 | 48.9 | — | — | |
| Qwen3-8B-BaseTraining=RLAD (ours), Context=30K2026.02 | 47.8 | 85.4 | 66.5 | |
| PACRBase Model=Qwen2.5-Math-7B, Decoding Strategy=Greedy (T=0)2026.06 | 43.3 | — | — | |
| Scaf-GRPOBase Model=Qwen2.5-Math-7B, Decoding Strategy=Greedy (T=0)2026.06 | 43.3 | — | — | |
| Qwen3-8B-BaseTraining=KDRL, Context=30K2026.02 | 42.1 | 86.1 | 64.9 | |
| CoVerRLBackbone=Qwen3-4B2026.05 | 40.5 | — | — | |
| SCOPEBackbone=Qwen3-4B2026.05 | 38.8 | — | — | |
| TTRL (w/ MPS)Backbone=Qwen3-4B2026.05 | 38 | — | — | |
| TTRL-GuardBackbone=Qwen3-4B2026.05 | 37.8 | — | — | |
| Qwen3-8B-BaseTraining=GRPO, Context=30K2026.02 | 37.7 | 77.8 | 61 | |
| TTRLBackbone=Qwen3-4B2026.05 | 36.7 | — | — | |
| TTRL (w/ RCSU)Backbone=Qwen3-4B2026.05 | 36.4 | — | — | |
| TTRL (w/ FRS)Backbone=Qwen3-4B2026.05 | 35.5 | — | — | |
| GRPO-SBase Model=Qwen2.5-7B, Decoding Strategy=Greedy (T=0)2026.06 | 34.7 | — | — | |
| GTPOBase Model=Qwen2.5-7B, Decoding Strategy=Greedy (T=0)2026.06 | 34.2 | — | — | |
| ISPOBase Model=Qwen2.5-7B, Decoding Strategy=Greedy (T=0)2026.06 | 32.2 | — | — | |
| Vanilla GRPOBase Model=Qwen2.5-Math-7B, Decoding Strategy=Greedy (T=0)2026.06 | 30 | — | — | |
| Dr. GRPOBase Model=Qwen2.5-Math-7B, Decoding Strategy=Greedy (T=0)2026.06 | 30 | — | — | |
| FG-ExPOBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.05 | 29.06 | 83.33 | — | |
| ISPOBase Model=Qwen2.5-Math-1.5B, Decoding Strategy=Greedy (T=0)2026.06 | 27.8 | — | — | |
| GRPOBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.05 | 27.4 | 73.33 | — | |
| Qwen3-8B-BaseTraining=SFT, Context=30K2026.02 | 26.7 | 65.8 | 56 | |
| PREPOBase Model=Qwen2.5-Math-7B, Decoding Strategy=Greedy (T=0)2026.06 | 26.2 | — | — | |
| PACRBase Model=Qwen2.5-Math-1.5B, Decoding Strategy=Greedy (T=0)2026.06 | 23.3 | — | — | |
| TTRL-GuardBackbone=Qwen2.5-7B-Instruct2026.05 | 21.9 | — | — | |
| CoVerRLBackbone=Qwen2.5-7B-Instruct2026.05 | 21.5 | — | — | |
| TTRL (w/ RCSU)Backbone=Qwen2.5-7B-Instruct2026.05 | 21.3 | — | — | |
| ProGRPOBase Model=Qwen2.5-7B, Decoding Strategy=Greedy (T=0)2026.06 | 21.3 | — | — | |
| SCOPEBackbone=Qwen2.5-7B-Instruct2026.05 | 21.1 | — | — | |
| BaseBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.05 | 20.73 | 63.33 | — | |
| TTRL (w/ MPS)Backbone=Qwen2.5-7B-Instruct2026.05 | 20.5 | — | — | |
| TTRL (w/ MPS)Backbone=Llama-3.2-3B-Instruct2026.05 | 20.3 | — | — | |
| TTRL (w/ FRS)Backbone=Qwen2.5-7B-Instruct2026.05 | 20.2 | — | — | |
| TTRLBackbone=Qwen2.5-7B-Instruct2026.05 | 20 | — | — | |
| Scaf-GRPOBase Model=Qwen2.5-Math-1.5B, Decoding Strategy=Greedy (T=0)2026.06 | 20 | — | — | |
| TTRL-GuardBackbone=Llama-3.2-3B-Instruct2026.05 | 19.5 | — | — | |
| Base ModelBackbone=Qwen2.5-7B-Instruct2026.05 | 18.1 | — | — | |
| SCOPEBackbone=Llama-3.2-3B-Instruct2026.05 | 17.1 | — | — | |
| TTRL (w/ FRS)Backbone=Llama-3.2-3B-Instruct2026.05 | 17.1 | — | — | |
| CoVerRLBackbone=Llama-3.2-3B-Instruct2026.05 | 16.9 | — | — | |
| TTRL (w/ RCSU)Backbone=Llama-3.2-3B-Instruct2026.05 | 16.7 | — | — | |
| PREPOBase Model=Qwen2.5-Math-1.5B, Decoding Strategy=Greedy (T=0)2026.06 | 16.7 | — | — | |
| Base modelBase Model=Qwen2.5-Math-7B, Decoding Strategy=Greedy (T=0)2026.06 | 16.7 | — | — | |
| PREPOBase Model=Qwen2.5-7B, Decoding Strategy=Greedy (T=0)2026.06 | 16.1 | — | — | |
| Qwen3-8B-BaseTraining=-, Context=30K2026.02 | 13.9 | 43.6 | 36.8 | |
| Llama-3.2-3B-Instruct + GRPO w/ VERL.Backbone=Llama-3.2-3B-Instruct, RL Method=GRPO, VERL=Enabled2025.09 | 13.3 | — | — | |
| Qwen2.5-7B + GRPO w/ VERL.Backbone=Qwen2.5-7B, RL Method=GRPO, VERL=Enabled2025.09 | 13.3 | — | — | |
| TTRLBackbone=Llama-3.2-3B-Instruct2026.05 | 13.3 | — | — | |
| Vanilla GRPOBase Model=Qwen2.5-Math-1.5B, Decoding Strategy=Greedy (T=0)2026.06 | 13.3 | — | — | |
| Dr. GRPOBase Model=Qwen2.5-Math-1.5B, Decoding Strategy=Greedy (T=0)2026.06 | 13.3 | — | — | |
| Scaf-GRPOBase Model=Qwen2.5-7B, Decoding Strategy=Greedy (T=0)2026.06 | 13.3 | — | — | |
| Qwen3-1.7B-BaseTraining=RLAD (ours), Context=30K2026.02 | 12.1 | 35.1 | 39 | |
| Qwen3-1.7B-BaseTraining=KDRL, Context=30K2026.02 | 10.2 | 32.8 | 37.2 | |
| Qwen3-1.7B-BaseTraining=GRPO, Context=30K2026.02 | 10 | 30.8 | 36.5 | |
| Llama-3.2-3B-Instruct + PPOBackbone=Llama-3.2-3B-Instruct, RL Method=PPO2025.09 | 10 | — | — | |
| Llama-3.2-3B-Instruct + PPO w/ VERL.Backbone=Llama-3.2-3B-Instruct, RL Method=PPO, VERL=Enabled2025.09 | 10 | — | — | |
| Llama-3.1-8B-Instruct + GRPO w/ VERL.Backbone=Llama-3.1-8B-Instruct, RL Method=GRPO, VERL=Enabled2025.09 | 10 | — | — | |
| Llama-3.1-8B-Instruct + PPO w/ VERL.Backbone=Llama-3.1-8B-Instruct, RL Method=PPO, VERL=Enabled2025.09 | 10 | — | — | |
| Qwen2.5-7B + GRPOBackbone=Qwen2.5-7B, RL Method=GRPO2025.09 | 10 | — | — | |
| Qwen2.5-7B + PPO w/ VERL.Backbone=Qwen2.5-7B, RL Method=PPO, VERL=Enabled2025.09 | 10 | — | — | |
| Mathstral-7B-v0.1 + PPO w/ VERL.Backbone=Mathstral-7B-v0.1, RL Method=PPO, VERL=Enabled2025.09 | 10 | — | — | |
| Vanilla GRPOBase Model=Qwen2.5-7B, Decoding Strategy=Greedy (T=0)2026.06 | 9.2 | — | — | |
| Base modelBase Model=Qwen2.5-Math-1.5B, Decoding Strategy=Greedy (T=0)2026.06 | 7.2 | — | — | |
| Llama-3.1-8B-Instruct + GRPOBackbone=Llama-3.1-8B-Instruct, RL Method=GRPO2025.09 | 6.7 | — | — | |
| Llama-3.1-8B-Instruct + PPOBackbone=Llama-3.1-8B-Instruct, RL Method=PPO2025.09 | 6.7 | — | — | |
| Qwen2.5-3BBackbone=Qwen2.5-3B, RL Method=None2025.09 | 6.7 | — | — | |
| Qwen2.5-3B + GRPO w/ VERL.Backbone=Qwen2.5-3B, RL Method=GRPO, VERL=Enabled2025.09 | 6.7 | — | — | |
| Qwen2.5-3B + PPO w/ VERL.Backbone=Qwen2.5-3B, RL Method=PPO, VERL=Enabled2025.09 | 6.7 | — | — | |
| Qwen2.5-7BBackbone=Qwen2.5-7B, RL Method=None2025.09 | 6.7 | — | — | |
| Qwen2.5-7B + PPOBackbone=Qwen2.5-7B, RL Method=PPO2025.09 | 6.7 | — | — | |
| Mathstral-7B-v0.1 + GRPO w/ VERL.Backbone=Mathstral-7B-v0.1, RL Method=GRPO, VERL=Enabled2025.09 | 6.7 | — | — | |
| Mathstral-7B-v0.1 + PPOBackbone=Mathstral-7B-v0.1, RL Method=PPO2025.09 | 6.7 | — | — | |
| Base modelBase Model=Qwen2.5-7B, Decoding Strategy=Greedy (T=0)2026.06 | 5.4 | — | — | |
| Base ModelBackbone=Llama-3.2-3B-Instruct2026.05 | 4.7 | — | — | |
| Llama-3.2-3B-Instruct + GRPOBackbone=Llama-3.2-3B-Instruct, RL Method=GRPO2025.09 | 3.3 | — | — | |
| Qwen2.5-3B + GRPOBackbone=Qwen2.5-3B, RL Method=GRPO2025.09 | 3.3 | — | — | |
| Qwen2.5-3B + PPOBackbone=Qwen2.5-3B, RL Method=PPO2025.09 | 3.3 | — | — | |
| Base ModelBackbone=Qwen3-4B2026.05 | 3.3 | — | — | |
| Qwen3-1.7B-BaseTraining=-, Context=30K2026.02 | 2.1 | 20.8 | 22.2 | |
| Llama-3.2-3B-InstructBackbone=Llama-3.2-3B-Instruct, RL Method=None2025.09 | 0 | — | — | |
| Llama-3.1-8B-InstructBackbone=Llama-3.1-8B-Instruct, RL Method=None2025.09 | 0 | — | — | |
| Mathstral-7B-v0.1Backbone=Mathstral-7B-v0.1, RL Method=None2025.09 | 0 | — | — | |
| Mathstral-7B-v0.1 + GRPOBackbone=Mathstral-7B-v0.1, RL Method=GRPO2025.09 | 0 | — | — | |
| Mistral-7B-v0.3Backbone=Mistral-7B-v0.3, RL Method=None2025.09 | 0 | — | — | |
| Mistral-7B-v0.3 + GRPOBackbone=Mistral-7B-v0.3, RL Method=GRPO2025.09 | 0 | — | — | |
| Mistral-7B-v0.3 + GRPO w/ VERL.Backbone=Mistral-7B-v0.3, RL Method=GRPO, VERL=Enabled2025.09 | 0 | — | — | |
| Mistral-7B-v0.3 + PPOBackbone=Mistral-7B-v0.3, RL Method=PPO2025.09 | 0 | — | — | |
| Mistral-7B-v0.3 + PPO w/ VERL.Backbone=Mistral-7B-v0.3, RL Method=PPO, VERL=Enabled2025.09 | 0 | — | — |