Mathematics on AMC (pass@1)
87.95pass@1GT-Reward
Evaluation Results
| Method | Links | |
|---|---|---|
| GT-RewardBase Model=Qwen3-8B-Base2025.11 | 87.95 | |
| GT-RewardBase Model=Qwen3-4B-Base2025.11 | 86.74 | |
| GT-RewardBase Model=Llama-3.2-3B-Instruct2025.11 | 83.13 | |
| GT-RewardBase Model=Llama-3.1-8B-Instruct2025.11 | 80.72 | |
| Scaf-GRPOBase Model=DeepSeek-R1-Distill-Qwen-1.5B2025.10 | 77.5 | |
| Scaf-GRPOBase Model=Qwen2.5-Math-7B2025.10 | 70 | |
| DeepSeek-R1-Distill-Qwen-1.5BBase Model=DeepSeek-R1-Distill-Qwen-1.5B2025.10 | 67.5 | |
| Vanilla GRPOBase Model=DeepSeek-R1-Distill-Qwen-1.5B2025.10 | 67.5 | |
| Oat-ZeroBase Model=Qwen2.5-Math-7B2025.10 | 62.5 | |
| LUFFYBase Model=Qwen2.5-Math-7B2025.10 | 62.5 | |
| Scaf-GRPOBase Model=Qwen2.5-Math-1.5B2025.10 | 60 | |
| Vanilla GRPOBase Model=Qwen2.5-Math-7B2025.10 | 60 | |
| Scaf-GRPOBase Model=Qwen2.5-7B2025.10 | 60 | |
| Self-HarmonyBase Model=Qwen3-8B-Base2025.11 | 59.04 | |
| Majority-VotingBase Model=Qwen3-8B-Base2025.11 | 59.03 | |
| SimpleRL-ZeroBase Model=Qwen2.5-Math-7B2025.10 | 55 | |
| GT-RewardBase Model=Qwen3-1.7B-Base2025.11 | 53.01 | |
| Co-RewardBase Model=Qwen3-8B-Base2025.11 | 51.8 | |
| IntuitorBase Model=Qwen3-8B-Base2025.11 | 51.65 | |
| RentBase Model=Qwen3-8B-Base2025.11 | 50.82 | |
| Vanilla GRPOBase Model=Qwen2.5-7B2025.10 | 50 | |
| Self-HarmonyBase Model=Qwen3-4B-Base2025.11 | 49.4 | |
| Majority-VotingBase Model=Qwen3-4B-Base2025.11 | 49.32 | |
| Vanilla GRPOBase Model=Qwen2.5-Math-1.5B2025.10 | 47.5 | |
| Co-RewardBase Model=Qwen3-4B-Base2025.11 | 46.98 | |
| Before RLBase Model=Qwen3-8B-Base2025.11 | 45.78 | |
| RentBase Model=Qwen3-4B-Base2025.11 | 45.25 | |
| IntuitorBase Model=Qwen3-4B-Base2025.11 | 43.59 | |
| Qwen2.5-Math-7BBase Model=Qwen2.5-Math-7B2025.10 | 42.5 | |
| Self-HarmonyBase Model=Qwen3-1.7B-Base2025.11 | 40.51 | |
| Scaf-GRPOBase Model=Llama-3.2-3B-Instruct2025.10 | 40 | |
| Co-RewardBase Model=Qwen3-1.7B-Base2025.11 | 39.75 | |
| Majority-VotingBase Model=Qwen3-1.7B-Base2025.11 | 37.65 | |
| Qwen2.5-7BBase Model=Qwen2.5-7B2025.10 | 37.5 | |
| Vanilla GRPOBase Model=Llama-3.2-3B-Instruct2025.10 | 35 | |
| Before RLBase Model=Qwen3-4B-Base2025.11 | 34.94 | |
| Qwen2.5-Math-1.5BBase Model=Qwen2.5-Math-1.5B2025.10 | 32.5 | |
| RentBase Model=Qwen3-1.7B-Base2025.11 | 32 | |
| Self-HarmonyBase Model=Llama-3.1-8B-Instruct2025.11 | 26.51 | |
| Before RLBase Model=Qwen3-1.7B-Base2025.11 | 26.5 | |
| Co-RewardBase Model=Llama-3.2-3B-Instruct2025.11 | 25.3 | |
| Self-HarmonyBase Model=Llama-3.2-3B-Instruct2025.11 | 25.3 | |
| IntuitorBase Model=Llama-3.2-3B-Instruct2025.11 | 23.79 | |
| RentBase Model=Llama-3.2-3B-Instruct2025.11 | 23.79 | |
| IntuitorBase Model=Qwen3-1.7B-Base2025.11 | 23.56 | |
| RentBase Model=Llama-3.1-8B-Instruct2025.11 | 21.98 | |
| Majority-VotingBase Model=Llama-3.1-8B-Instruct2025.11 | 21.53 | |
| Majority-VotingBase Model=Llama-3.2-3B-Instruct2025.11 | 20.48 | |
| Before RLBase Model=Llama-3.1-8B-Instruct2025.11 | 20.48 | |
| Llama-3.2-3B-InstructBase Model=Llama-3.2-3B-Instruct2025.10 | 20 | |
| Before RLBase Model=Llama-3.2-3B-Instruct2025.11 | 19.27 | |
| Co-RewardBase Model=Llama-3.1-8B-Instruct2025.11 | 17.84 | |
| IntuitorBase Model=Llama-3.1-8B-Instruct2025.11 | 6.62 |