Mathematical Reasoning on AIME 2025 (Pass@1, Pass@32, Avg)
43.33Pass@1FG-ExPO
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| FG-ExPOBackbone=Qwen3-8B-Base2026.05 | 43.33 | 76.67 | — | |
| GRPOBackbone=Qwen3-8B-Base2026.05 | 40 | 63.33 | — | |
| TTRL-GuardBackbone=Qwen3-4B2026.05 | 36.2 | — | — | |
| TTRL (w/ FRS)Backbone=Qwen3-4B2026.05 | 36.1 | — | — | |
| TTRL (w/ RCSU)Backbone=Qwen3-4B2026.05 | 35.9 | — | — | |
| SCOPEBackbone=Qwen3-4B2026.05 | 35.6 | — | — | |
| TTRL (w/ MPS)Backbone=Qwen3-4B2026.05 | 35.6 | — | — | |
| TTRLBackbone=Qwen3-4B2026.05 | 33.3 | — | — | |
| CoVerRLBackbone=Qwen3-4B2026.05 | 31.8 | — | — | |
| Qwen3-8B-BaseTraining=RLAD (ours), Context=30K2026.02 | 31.7 | 66.4 | 66.5 | |
| Qwen3-8B-BaseTraining=KDRL, Context=30K2026.02 | 27.8 | 65.2 | 64.9 | |
| ISPOBase Model=Qwen2.5-Math-7B, Decoding Strategy=Greedy (T=0)2026.06 | 24.4 | — | — | |
| TTRL-GuardBackbone=Qwen2.5-7B-Instruct2026.05 | 24.1 | — | — | |
| TTRL (w/ FRS)Backbone=Qwen2.5-7B-Instruct2026.05 | 23.3 | — | — | |
| ISPOBase Model=Qwen2.5-7B, Decoding Strategy=Greedy (T=0)2026.06 | 23.3 | — | — | |
| FG-ExPOBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.05 | 23.12 | 60 | — | |
| Qwen3-8B-BaseTraining=GRPO, Context=30K2026.02 | 22.8 | 48.5 | 61 | |
| GRPOBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.05 | 22.6 | 56.67 | — | |
| ISPOBase Model=Qwen2.5-Math-1.5B, Decoding Strategy=Greedy (T=0)2026.06 | 22.2 | — | — | |
| Qwen3-8B-BaseTraining=SFT, Context=30K2026.02 | 20.8 | 41.5 | 56 | |
| TTRL (w/ RCSU)Backbone=Qwen2.5-7B-Instruct2026.05 | 20.1 | — | — | |
| TTRL (w/ MPS)Backbone=Qwen2.5-7B-Instruct2026.05 | 20 | — | — | |
| PREPOBase Model=Qwen2.5-Math-1.5B, Decoding Strategy=Greedy (T=0)2026.06 | 20 | — | — | |
| Scaf-GRPOBase Model=Qwen2.5-Math-7B, Decoding Strategy=Greedy (T=0)2026.06 | 20 | — | — | |
| Scaf-GRPOBase Model=Qwen2.5-7B, Decoding Strategy=Greedy (T=0)2026.06 | 20 | — | — | |
| BaseBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.05 | 18.54 | 36.67 | — | |
| GRPO-SBase Model=Qwen2.5-7B, Decoding Strategy=Greedy (T=0)2026.06 | 18.3 | — | — | |
| CoVerRLBackbone=Qwen2.5-7B-Instruct2026.05 | 16.7 | — | — | |
| GTPOBase Model=Qwen2.5-7B, Decoding Strategy=Greedy (T=0)2026.06 | 16.7 | — | — | |
| ProGRPOBase Model=Qwen2.5-7B, Decoding Strategy=Greedy (T=0)2026.06 | 15.9 | — | — | |
| TTRLBackbone=Qwen2.5-7B-Instruct2026.05 | 15.6 | — | — | |
| SCOPEBackbone=Qwen2.5-7B-Instruct2026.05 | 14.6 | — | — | |
| Scaf-GRPOBase Model=Qwen2.5-Math-1.5B, Decoding Strategy=Greedy (T=0)2026.06 | 13.3 | — | — | |
| Base modelBase Model=Qwen2.5-Math-7B, Decoding Strategy=Greedy (T=0)2026.06 | 13.3 | — | — | |
| Vanilla GRPOBase Model=Qwen2.5-Math-7B, Decoding Strategy=Greedy (T=0)2026.06 | 13.3 | — | — | |
| PREPOBase Model=Qwen2.5-Math-7B, Decoding Strategy=Greedy (T=0)2026.06 | 12.8 | — | — | |
| PREPOBase Model=Qwen2.5-7B, Decoding Strategy=Greedy (T=0)2026.06 | 10.2 | — | — | |
| Qwen2.5-7B + GRPO w/ VERL.Backbone=Qwen2.5-7B, RL Method=GRPO, VERL=Enabled2025.09 | 10 | — | — | |
| Vanilla GRPOBase Model=Qwen2.5-Math-1.5B, Decoding Strategy=Greedy (T=0)2026.06 | 10 | — | — | |
| Qwen3-1.7B-BaseTraining=RLAD (ours), Context=30K2026.02 | 8.3 | 24.8 | 39 | |
| Llama-3.2-3B-Instruct + GRPO w/ VERL.Backbone=Llama-3.2-3B-Instruct, RL Method=GRPO, VERL=Enabled2025.09 | 6.7 | — | — | |
| Qwen2.5-7B + GRPOBackbone=Qwen2.5-7B, RL Method=GRPO2025.09 | 6.7 | — | — | |
| Qwen2.5-7B + PPO w/ VERL.Backbone=Qwen2.5-7B, RL Method=PPO, VERL=Enabled2025.09 | 6.7 | — | — | |
| Base ModelBackbone=Qwen2.5-7B-Instruct2026.05 | 6.4 | — | — | |
| Qwen3-1.7B-BaseTraining=KDRL, Context=30K2026.02 | 6.2 | 24.4 | 37.2 | |
| Vanilla GRPOBase Model=Qwen2.5-7B, Decoding Strategy=Greedy (T=0)2026.06 | 6.1 | — | — | |
| Qwen3-1.7B-BaseTraining=GRPO, Context=30K2026.02 | 5.7 | 24.2 | 36.5 | |
| Qwen3-8B-BaseTraining=-, Context=30K2026.02 | 4.7 | 24.1 | 36.8 | |
| Llama-3.2-3B-Instruct + PPOBackbone=Llama-3.2-3B-Instruct, RL Method=PPO2025.09 | 3.3 | — | — | |
| Llama-3.2-3B-Instruct + PPO w/ VERL.Backbone=Llama-3.2-3B-Instruct, RL Method=PPO, VERL=Enabled2025.09 | 3.3 | — | — | |
| Llama-3.1-8B-InstructBackbone=Llama-3.1-8B-Instruct, RL Method=None2025.09 | 3.3 | — | — | |
| Llama-3.1-8B-Instruct + GRPO w/ VERL.Backbone=Llama-3.1-8B-Instruct, RL Method=GRPO, VERL=Enabled2025.09 | 3.3 | — | — | |
| Qwen2.5-7B + PPOBackbone=Qwen2.5-7B, RL Method=PPO2025.09 | 3.3 | — | — | |
| Mathstral-7B-v0.1 + PPOBackbone=Mathstral-7B-v0.1, RL Method=PPO2025.09 | 3.3 | — | — | |
| TTRL (w/ FRS)Backbone=Llama-3.2-3B-Instruct2026.05 | 3.3 | — | — | |
| TTRL-GuardBackbone=Llama-3.2-3B-Instruct2026.05 | 3.3 | — | — | |
| Base modelBase Model=Qwen2.5-Math-1.5B, Decoding Strategy=Greedy (T=0)2026.06 | 3.3 | — | — | |
| Base modelBase Model=Qwen2.5-7B, Decoding Strategy=Greedy (T=0)2026.06 | 2.5 | — | — | |
| CoVerRLBackbone=Llama-3.2-3B-Instruct2026.05 | 1.8 | — | — | |
| Base ModelBackbone=Qwen3-4B2026.05 | 1.8 | — | — | |
| Qwen3-1.7B-BaseTraining=-, Context=30K2026.02 | 0.9 | 6.2 | 22.2 | |
| TTRL (w/ RCSU)Backbone=Llama-3.2-3B-Instruct2026.05 | 0.9 | — | — | |
| SCOPEBackbone=Llama-3.2-3B-Instruct2026.05 | 0.8 | — | — | |
| TTRL (w/ MPS)Backbone=Llama-3.2-3B-Instruct2026.05 | 0.8 | — | — | |
| Llama-3.2-3B-InstructBackbone=Llama-3.2-3B-Instruct, RL Method=None2025.09 | 0 | — | — | |
| Llama-3.2-3B-Instruct + GRPOBackbone=Llama-3.2-3B-Instruct, RL Method=GRPO2025.09 | 0 | — | — | |
| Llama-3.1-8B-Instruct + GRPOBackbone=Llama-3.1-8B-Instruct, RL Method=GRPO2025.09 | 0 | — | — | |
| Llama-3.1-8B-Instruct + PPOBackbone=Llama-3.1-8B-Instruct, RL Method=PPO2025.09 | 0 | — | — | |
| Llama-3.1-8B-Instruct + PPO w/ VERL.Backbone=Llama-3.1-8B-Instruct, RL Method=PPO, VERL=Enabled2025.09 | 0 | — | — | |
| Qwen2.5-3BBackbone=Qwen2.5-3B, RL Method=None2025.09 | 0 | — | — | |
| Qwen2.5-3B + GRPOBackbone=Qwen2.5-3B, RL Method=GRPO2025.09 | 0 | — | — | |
| Qwen2.5-3B + GRPO w/ VERL.Backbone=Qwen2.5-3B, RL Method=GRPO, VERL=Enabled2025.09 | 0 | — | — | |
| Qwen2.5-3B + PPOBackbone=Qwen2.5-3B, RL Method=PPO2025.09 | 0 | — | — | |
| Qwen2.5-3B + PPO w/ VERL.Backbone=Qwen2.5-3B, RL Method=PPO, VERL=Enabled2025.09 | 0 | — | — | |
| Qwen2.5-7BBackbone=Qwen2.5-7B, RL Method=None2025.09 | 0 | — | — | |
| Mathstral-7B-v0.1Backbone=Mathstral-7B-v0.1, RL Method=None2025.09 | 0 | — | — | |
| Mathstral-7B-v0.1 + GRPOBackbone=Mathstral-7B-v0.1, RL Method=GRPO2025.09 | 0 | — | — | |
| Mathstral-7B-v0.1 + GRPO w/ VERL.Backbone=Mathstral-7B-v0.1, RL Method=GRPO, VERL=Enabled2025.09 | 0 | — | — | |
| Mathstral-7B-v0.1 + PPO w/ VERL.Backbone=Mathstral-7B-v0.1, RL Method=PPO, VERL=Enabled2025.09 | 0 | — | — | |
| Mistral-7B-v0.3Backbone=Mistral-7B-v0.3, RL Method=None2025.09 | 0 | — | — | |
| Mistral-7B-v0.3 + GRPOBackbone=Mistral-7B-v0.3, RL Method=GRPO2025.09 | 0 | — | — | |
| Mistral-7B-v0.3 + GRPO w/ VERL.Backbone=Mistral-7B-v0.3, RL Method=GRPO, VERL=Enabled2025.09 | 0 | — | — | |
| Mistral-7B-v0.3 + PPOBackbone=Mistral-7B-v0.3, RL Method=PPO2025.09 | 0 | — | — | |
| Mistral-7B-v0.3 + PPO w/ VERL.Backbone=Mistral-7B-v0.3, RL Method=PPO, VERL=Enabled2025.09 | 0 | — | — | |
| Base ModelBackbone=Llama-3.2-3B-Instruct2026.05 | 0 | — | — | |
| TTRLBackbone=Llama-3.2-3B-Instruct2026.05 | 0 | — | — |