Mathematical Reasoning on AMC 24 (Pass@128)
79Pass@128Qwen2.5-7B + GRPO w/ VERL.
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen2.5-7B + GRPO w/ VERL.Base Model=Qwen2.5-7B, RL Framework=GRPO, VERL Integration=true, Decoding Setting=Pass@1282025.09 | 79 | |
| Qwen2.5-7B + GRPO w/ VERL.k=128, Base Model=Qwen2.5-7B, RL Method=GRPO, Framework=VERL2025.09 | 79 | |
| Qwen2.5-7B + GRPOBase Model=Qwen2.5-7B, RL Framework=GRPO, Decoding Setting=Pass@1282025.09 | 78.3 | |
| Qwen2.5-7B + GRPOk=128, Base Model=Qwen2.5-7B, RL Method=GRPO2025.09 | 78.3 | |
| Mathstral-7B-v0.1 + GRPO w/ VERL.k=128, Base Model=Mathstral-7B-v0.1, RL Method=GRPO, Framework=VERL2025.09 | 76.9 | |
| Qwen2.5-7B + PPO w/ VERL.Base Model=Qwen2.5-7B, RL Framework=PPO, VERL Integration=true, Decoding Setting=Pass@1282025.09 | 74.4 | |
| Qwen2.5-7B + PPO w/ VERL.k=128, Base Model=Qwen2.5-7B, RL Method=PPO, Framework=VERL2025.09 | 74.4 | |
| Qwen2.5-7B + PPOBase Model=Qwen2.5-7B, RL Framework=PPO, Decoding Setting=Pass@1282025.09 | 74.3 | |
| Qwen2.5-7B + PPOk=128, Base Model=Qwen2.5-7B, RL Method=PPO2025.09 | 74.3 | |
| Qwen2.5-7BBase Model=Qwen2.5-7B, RL Framework=None, Decoding Setting=Pass@1282025.09 | 73.7 | |
| Qwen2.5-7Bk=128, Base Model=Qwen2.5-7B2025.09 | 73.7 | |
| Mathstral-7B-v0.1 + PPOk=128, Base Model=Mathstral-7B-v0.1, RL Method=PPO2025.09 | 70.7 | |
| Mathstral-7B-v0.1 + PPO w/ VERL.k=128, Base Model=Mathstral-7B-v0.1, RL Method=PPO, Framework=VERL2025.09 | 69.9 | |
| Mathstral-7B-v0.1 + GRPOk=128, Base Model=Mathstral-7B-v0.1, RL Method=GRPO2025.09 | 69.2 | |
| Qwen2.5-3Bk=128, Base Model=Qwen2.5-3B2025.09 | 69 | |
| Qwen2.5-3B + GRPOk=128, Base Model=Qwen2.5-3B, RL Method=GRPO2025.09 | 68.5 | |
| Qwen2.5-3B + PPOk=128, Base Model=Qwen2.5-3B, RL Method=PPO2025.09 | 67.9 | |
| Qwen2.5-3B + GRPO w/ VERL.k=128, Base Model=Qwen2.5-3B, RL Method=GRPO, Framework=VERL2025.09 | 67.8 | |
| Qwen2.5-3B + PPO w/ VERL.k=128, Base Model=Qwen2.5-3B, RL Method=PPO, Framework=VERL2025.09 | 67.3 | |
| Llama-3.1-8B-Instruct + GRPO w/ VERL.k=128, Base Model=Llama-3.1-8B-Instruct, RL Method=GRPO, Framework=VERL2025.09 | 63.1 | |
| Mathstral-7B-v0.1k=128, Base Model=Mathstral-7B-v0.12025.09 | 60.9 | |
| Llama-3.2-3B-Instruct + GRPOBase Model=Llama-3.2-3B-Instruct, RL Framework=GRPO, Decoding Setting=Pass@1282025.09 | 60.6 | |
| Llama-3.2-3B-Instruct + GRPOk=128, Base Model=Llama-3.2-3B-Instruct, RL Method=GRPO2025.09 | 60.6 | |
| Llama-3.1-8B-Instruct + PPO w/ VERL.k=128, Base Model=Llama-3.1-8B-Instruct, RL Method=PPO, Framework=VERL2025.09 | 60 | |
| Llama-3.2-3B-Instruct + GRPO w/ VERL.Base Model=Llama-3.2-3B-Instruct, RL Framework=GRPO, VERL Integration=true, Decoding Setting=Pass@1282025.09 | 59 | |
| Llama-3.2-3B-Instruct + GRPO w/ VERL.k=128, Base Model=Llama-3.2-3B-Instruct, RL Method=GRPO, Framework=VERL2025.09 | 59 | |
| Llama-3.1-8B-Instruct + PPOk=128, Base Model=Llama-3.1-8B-Instruct, RL Method=PPO2025.09 | 59 | |
| Llama-3.2-3B-Instruct + PPO w/ VERL.Base Model=Llama-3.2-3B-Instruct, RL Framework=PPO, VERL Integration=true, Decoding Setting=Pass@1282025.09 | 57.8 | |
| Llama-3.2-3B-Instruct + PPO w/ VERL.k=128, Base Model=Llama-3.2-3B-Instruct, RL Method=PPO, Framework=VERL2025.09 | 57.8 | |
| Llama-3.1-8B-Instructk=128, Base Model=Llama-3.1-8B-Instruct2025.09 | 57.4 | |
| Llama-3.2-3B-Instruct + PPOBase Model=Llama-3.2-3B-Instruct, RL Framework=PPO, Decoding Setting=Pass@1282025.09 | 57 | |
| Llama-3.2-3B-Instruct + PPOk=128, Base Model=Llama-3.2-3B-Instruct, RL Method=PPO2025.09 | 57 | |
| Llama-3.1-8B-Instruct + GRPOk=128, Base Model=Llama-3.1-8B-Instruct, RL Method=GRPO2025.09 | 56.9 | |
| Llama-3.2-3B-InstructBase Model=Llama-3.2-3B-Instruct, RL Framework=None, Decoding Setting=Pass@1282025.09 | 51.5 | |
| Llama-3.2-3B-Instructk=128, Base Model=Llama-3.2-3B-Instruct2025.09 | 51.5 | |
| Mistral-7B-v0.3k=128, Base Model=Mistral-7B-v0.32025.09 | 39.6 | |
| Mistral-7B-v0.3 + GRPO w/ VERL.k=128, Base Model=Mistral-7B-v0.3, RL Method=GRPO, Framework=VERL2025.09 | 38 | |
| Mistral-7B-v0.3 + GRPOk=128, Base Model=Mistral-7B-v0.3, RL Method=GRPO2025.09 | 36 | |
| Mistral-7B-v0.3 + PPO w/ VERL.k=128, Base Model=Mistral-7B-v0.3, RL Method=PPO, Framework=VERL2025.09 | 30.1 | |
| Mistral-7B-v0.3 + PPOk=128, Base Model=Mistral-7B-v0.3, RL Method=PPO2025.09 | 25.1 |