Mathematical Reasoning on AMC 23 (Pass@1 accuracy)
75.1Pass@1 AccuracyHölderPO
Evaluation Results
| Method | Links | |
|---|---|---|
| HölderPOTraining Stage=RL Post-Trained Models, Backbone=Qwen3-8B-Base, Training Objective=Linear Des: 2 → -22026.05 | 75.1 | |
| DAPOTraining Stage=RL Post-Trained Models, Backbone=Qwen3-8B-Base2026.05 | 75 | |
| GRPOTraining Stage=RL Post-Trained Models, Backbone=Qwen3-8B-Base2026.05 | 67.5 | |
| GSPOTraining Stage=RL Post-Trained Models, Backbone=Qwen3-8B-Base2026.05 | 67.5 | |
| Qwen3-8B-BaseTraining Stage=Base Model, Backbone=Qwen3-8B-Base2026.05 | 45 |