Accuracy on AIME 24
28.54AccuracyDAPO
Evaluation Results
| Method | Links | |
|---|---|---|
| DAPOAlgorithm=DAPO, Stage=Fully Trained, Base Model=Qwen3-8B2025.10 | 28.54 | |
| AlphaRL-enhanced DAPOAlgorithm=DAPO, Stage=40%, Base Model=Qwen3-8B2025.10 | 28.33 | |
| RLOOAlgorithm=RLOO, Stage=Fully Trained, Base Model=Qwen3-8B2025.10 | 27.5 | |
| GRPOAlgorithm=GRPO, Stage=Fully Trained, Base Model=Qwen3-8B2025.10 | 26.4 | |
| AlphaRL-enhanced GRPOAlgorithm=GRPO, Stage=40%, Base Model=Qwen3-8B2025.10 | 22.25 | |
| AlphaRL-enhanced RLOOAlgorithm=RLOO, Stage=40%, Base Model=Qwen3-8B2025.10 | 17.92 | |
| RLOOAlgorithm=RLOO, Stage=40%, Base Model=Qwen3-8B2025.10 | 16.67 | |
| GRPOAlgorithm=GRPO, Stage=40%, Base Model=Qwen3-8B2025.10 | 15.83 | |
| DAPOAlgorithm=DAPO, Stage=40%, Base Model=Qwen3-8B2025.10 | 15.8 | |
| AlphaRL-enhanced DAPOAlgorithm=DAPO, Stage=10%, Base Model=Qwen3-8B2025.10 | 15 | |
| DAPOAlgorithm=DAPO, Stage=10%, Base Model=Qwen3-8B2025.10 | 12.5 | |
| AlphaRL-enhanced GRPOAlgorithm=GRPO, Stage=10%, Base Model=Qwen3-8B2025.10 | 12.5 | |
| RLOOAlgorithm=RLOO, Stage=10%, Base Model=Qwen3-8B2025.10 | 11.67 | |
| AlphaRL-enhanced RLOOAlgorithm=RLOO, Stage=10%, Base Model=Qwen3-8B2025.10 | 11.67 | |
| GRPOAlgorithm=GRPO, Stage=10%, Base Model=Qwen3-8B2025.10 | 9.17 |