Reasoning on AIME 25 (Accuracy)
24.17AIME 25 AccuracyDAPO
Evaluation Results
| Method | Links | |
|---|---|---|
| DAPOAlgorithm=DAPO, Stage=Fully Trained, Base Model=Qwen3-8B2025.10 | 24.17 | |
| AlphaRL-enhanced DAPOAlgorithm=DAPO, Stage=40%, Base Model=Qwen3-8B2025.10 | 23.75 | |
| GRPOAlgorithm=GRPO, Stage=Fully Trained, Base Model=Qwen3-8B2025.10 | 21.67 | |
| RLOOAlgorithm=RLOO, Stage=Fully Trained, Base Model=Qwen3-8B2025.10 | 18.33 | |
| AlphaRL-enhanced RLOOAlgorithm=RLOO, Stage=40%, Base Model=Qwen3-8B2025.10 | 18.33 | |
| AlphaRL-enhanced GRPOAlgorithm=GRPO, Stage=40%, Base Model=Qwen3-8B2025.10 | 18.13 | |
| GRPOAlgorithm=GRPO, Stage=40%, Base Model=Qwen3-8B2025.10 | 14.17 | |
| RLOOAlgorithm=RLOO, Stage=40%, Base Model=Qwen3-8B2025.10 | 14.17 | |
| AlphaRL-enhanced RLOOAlgorithm=RLOO, Stage=10%, Base Model=Qwen3-8B2025.10 | 14.17 | |
| AlphaRL-enhanced GRPOAlgorithm=GRPO, Stage=10%, Base Model=Qwen3-8B2025.10 | 13.25 | |
| DAPOAlgorithm=DAPO, Stage=40%, Base Model=Qwen3-8B2025.10 | 11.67 | |
| AlphaRL-enhanced DAPOAlgorithm=DAPO, Stage=10%, Base Model=Qwen3-8B2025.10 | 11.67 | |
| GRPOAlgorithm=GRPO, Stage=10%, Base Model=Qwen3-8B2025.10 | 8.33 | |
| RLOOAlgorithm=RLOO, Stage=10%, Base Model=Qwen3-8B2025.10 | 8.33 | |
| DAPOAlgorithm=DAPO, Stage=10%, Base Model=Qwen3-8B2025.10 | 7.5 |