Mathematical Reasoning on DAPO (test)
72.8Success RateTROLL
Evaluation Results
| Method | Links | |
|---|---|---|
| TROLLModel=Qwen3-8B, Advantage Estimation=RF++2025.10 | 72.8 | |
| TROLLModel=Qwen3-8B, Advantage Estimation=PPO2025.10 | 71.5 | |
| TROLLModel=Qwen3-8B, Advantage Estimation=GSPO2025.10 | 70.6 | |
| TROLLModel=Qwen3-8B, Advantage Estimation=GRPO2025.10 | 69.1 | |
| TROLLModel=Qwen3-8B, Advantage Estimation=Dr.GRPO2025.10 | 67.4 | |
| ClipModel=Qwen3-8B, Advantage Estimation=Dr.GRPO2025.10 | 65.3 | |
| ClipModel=Qwen3-8B, Advantage Estimation=GRPO2025.10 | 64 | |
| ClipModel=Qwen3-8B, Advantage Estimation=RF++2025.10 | 62.6 | |
| ClipModel=Qwen3-8B, Advantage Estimation=PPO2025.10 | 60.2 | |
| TROLLModel=Qwen2.5-7B-Instruct, Advantage Estimation=GSPO2025.10 | 39 | |
| TROLLModel=Qwen2.5-7B-Instruct, Advantage Estimation=GRPO2025.10 | 38.9 | |
| TROLLModel=Qwen2.5-7B-Instruct, Advantage Estimation=Dr.GRPO2025.10 | 38.9 | |
| TROLLModel=Qwen2.5-7B-Instruct, Advantage Estimation=RF++2025.10 | 38 | |
| TROLLModel=Qwen2.5-7B-Instruct, Advantage Estimation=PPO2025.10 | 35.3 | |
| ClipModel=Qwen2.5-7B-Instruct, Advantage Estimation=Dr.GRPO2025.10 | 33.1 | |
| ClipModel=Qwen2.5-7B-Instruct, Advantage Estimation=PPO2025.10 | 32.4 | |
| ClipModel=Qwen2.5-7B-Instruct, Advantage Estimation=GRPO2025.10 | 32.3 | |
| ClipModel=Qwen2.5-7B-Instruct, Advantage Estimation=RF++2025.10 | 32.3 | |
| ClipModel=Qwen2.5-7B-Instruct, Advantage Estimation=GSPO2025.10 | 9.3 | |
| ClipModel=Qwen3-8B, Advantage Estimation=GSPO2025.10 | 0 |