Reasoning on MINERVA
44.02AccuracyDAPO
Evaluation Results
| Method | Links | |
|---|---|---|
| DAPOAlgorithm=DAPO, Stage=Fully Trained2025.10 | 44.02 | |
| AlphaRL-enhanced DAPOAlgorithm=DAPO, Stage=40%2025.10 | 43.27 | |
| GRPOAlgorithm=GRPO, Stage=Fully Trained2025.10 | 42.19 | |
| RLOOAlgorithm=RLOO, Stage=Fully Trained2025.10 | 41.9 | |
| AlphaRL-enhanced RLOOAlgorithm=RLOO, Stage=40%2025.10 | 40.6 | |
| AlphaRL-enhanced DAPOAlgorithm=DAPO, Stage=10%2025.10 | 40.46 | |
| AlphaRL-enhanced GRPOAlgorithm=GRPO, Stage=40%2025.10 | 40.12 | |
| RLOOAlgorithm=RLOO, Stage=40%2025.10 | 39.24 | |
| AlphaRL-enhanced RLOOAlgorithm=RLOO, Stage=10%2025.10 | 37.46 | |
| GRPOAlgorithm=GRPO, Stage=40%2025.10 | 37.3 | |
| DAPOAlgorithm=DAPO, Stage=40%2025.10 | 37.07 | |
| AlphaRL-enhanced GRPOAlgorithm=GRPO, Stage=10%2025.10 | 36.83 | |
| RLOOAlgorithm=RLOO, Stage=10%2025.10 | 35.02 | |
| DAPOAlgorithm=DAPO, Stage=10%2025.10 | 32.07 | |
| GRPOAlgorithm=GRPO, Stage=10%2025.10 | 31.89 |