Mathematical Reasoning on DAPO (train)
74.4Success RateTROLL
Evaluation Results
| Method | Links | |
|---|---|---|
| TROLLModel=Qwen3-8B, Advantage Estimation=PPO2025.10 | 74.4 | |
| TROLLModel=Qwen3-8B, Advantage Estimation=RF++2025.10 | 74.2 | |
| TROLLModel=Qwen3-8B, Advantage Estimation=GSPO2025.10 | 73.6 | |
| TROLLModel=Qwen3-8B, Advantage Estimation=GRPO2025.10 | 72.1 | |
| TROLLModel=Qwen3-8B, Advantage Estimation=Dr.GRPO2025.10 | 70.4 | |
| ClipModel=Qwen3-8B, Advantage Estimation=Dr.GRPO2025.10 | 67.8 | |
| ClipModel=Qwen3-8B, Advantage Estimation=GRPO2025.10 | 66.7 | |
| ClipModel=Qwen3-8B, Advantage Estimation=RF++2025.10 | 64.8 | |
| ClipModel=Qwen3-8B, Advantage Estimation=PPO2025.10 | 64 | |
| TROLLModel=Qwen2.5-7B-Instruct, Advantage Estimation=Dr.GRPO2025.10 | 51.3 | |
| TROLLModel=Qwen2.5-7B-Instruct, Advantage Estimation=GRPO2025.10 | 49.5 | |
| TROLLModel=Qwen2.5-7B-Instruct, Advantage Estimation=RF++2025.10 | 48.6 | |
| TROLLModel=Qwen2.5-7B-Instruct, Advantage Estimation=GSPO2025.10 | 48.1 | |
| ClipModel=Qwen2.5-7B-Instruct, Advantage Estimation=Dr.GRPO2025.10 | 46.7 | |
| ClipModel=Qwen2.5-7B-Instruct, Advantage Estimation=PPO2025.10 | 44.4 | |
| ClipModel=Qwen2.5-7B-Instruct, Advantage Estimation=GRPO2025.10 | 44.3 | |
| TROLLModel=Qwen2.5-7B-Instruct, Advantage Estimation=PPO2025.10 | 43.1 | |
| ClipModel=Qwen2.5-7B-Instruct, Advantage Estimation=RF++2025.10 | 42.9 | |
| ClipModel=Qwen2.5-7B-Instruct, Advantage Estimation=GSPO2025.10 | 15.9 | |
| ClipModel=Qwen3-8B, Advantage Estimation=GSPO2025.10 | 0 |