Mathematical Problem Solving on MATH eval (test)
59.1Success RateTROLL
Evaluation Results
| Method | Links | |
|---|---|---|
| TROLLModel=Qwen3-8B, Advantage Estimation=PPO2025.10 | 59.1 | |
| TROLLModel=Qwen3-8B, Advantage Estimation=GSPO2025.10 | 58 | |
| TROLLModel=Qwen3-8B, Advantage Estimation=RF++2025.10 | 57.8 | |
| TROLLModel=Qwen3-8B, Advantage Estimation=GRPO2025.10 | 55.1 | |
| ClipModel=Qwen3-8B, Advantage Estimation=Dr.GRPO2025.10 | 54.9 | |
| TROLLModel=Qwen3-8B, Advantage Estimation=Dr.GRPO2025.10 | 54.6 | |
| ClipModel=Qwen3-8B, Advantage Estimation=GRPO2025.10 | 54.1 | |
| ClipModel=Qwen3-8B, Advantage Estimation=RF++2025.10 | 52 | |
| ClipModel=Qwen3-8B, Advantage Estimation=PPO2025.10 | 50.8 | |
| TROLLModel=Qwen2.5-7B-Instruct, Advantage Estimation=Dr.GRPO2025.10 | 35.9 | |
| TROLLModel=Qwen2.5-7B-Instruct, Advantage Estimation=GRPO2025.10 | 35 | |
| TROLLModel=Qwen2.5-7B-Instruct, Advantage Estimation=PPO2025.10 | 34.9 | |
| TROLLModel=Qwen2.5-7B-Instruct, Advantage Estimation=RF++2025.10 | 34.4 | |
| TROLLModel=Qwen2.5-7B-Instruct, Advantage Estimation=GSPO2025.10 | 33.3 | |
| ClipModel=Qwen2.5-7B-Instruct, Advantage Estimation=PPO2025.10 | 31.9 | |
| ClipModel=Qwen2.5-7B-Instruct, Advantage Estimation=Dr.GRPO2025.10 | 31.7 | |
| ClipModel=Qwen2.5-7B-Instruct, Advantage Estimation=GRPO2025.10 | 31.3 | |
| ClipModel=Qwen2.5-7B-Instruct, Advantage Estimation=RF++2025.10 | 31.1 | |
| ClipModel=Qwen2.5-7B-Instruct, Advantage Estimation=GSPO2025.10 | 12.7 | |
| ClipModel=Qwen3-8B, Advantage Estimation=GSPO2025.10 | 0 |