Accuracy on AIME25 (Mathematical Reasoning)
54.7AccuracyGraphPO
Evaluation Results
| Method | Links | |
|---|---|---|
| GraphPOModel=Deepseek-R1-Distill-Qwen-7B2026.06 | 54.7 | |
| PROSModel=Deepseek-R1-Distill-Qwen-7B2026.06 | 51.4 | |
| SPOModel=Deepseek-R1-Distill-Qwen-7B2026.06 | 50.7 | |
| TREE-GRPOModel=Deepseek-R1-Distill-Qwen-7B2026.06 | 50.5 | |
| TreePOModel=Deepseek-R1-Distill-Qwen-7B2026.06 | 49.6 | |
| TreeRLModel=Deepseek-R1-Distill-Qwen-7B2026.06 | 49.5 | |
| DAPOModel=Deepseek-R1-Distill-Qwen-7B2026.06 | 48.6 | |
| GRPOModel=Deepseek-R1-Distill-Qwen-7B2026.06 | 47.4 | |
| BaseModel=Deepseek-R1-Distill-Qwen-7B2026.06 | 38.4 | |
| GraphPOModel=Qwen3-8B-Base2026.06 | 30.9 | |
| PROSModel=Qwen3-8B-Base2026.06 | 27.5 | |
| SPOModel=Qwen3-8B-Base2026.06 | 27.1 | |
| TREE-GRPOModel=Qwen3-8B-Base2026.06 | 26.7 | |
| TreePOModel=Qwen3-8B-Base2026.06 | 25.4 | |
| TreeRLModel=Qwen3-8B-Base2026.06 | 25.1 | |
| GraphPOModel=Qwen2.5-7B-Math2026.06 | 24.5 | |
| DAPOModel=Qwen3-8B-Base2026.06 | 23.8 | |
| GRPOModel=Qwen3-8B-Base2026.06 | 21.3 | |
| PROSModel=Qwen2.5-7B-Math2026.06 | 21 | |
| BaseModel=Qwen3-8B-Base2026.06 | 20.8 | |
| SPOModel=Qwen2.5-7B-Math2026.06 | 20.4 | |
| TREE-GRPOModel=Qwen2.5-7B-Math2026.06 | 20.3 | |
| TreePOModel=Qwen2.5-7B-Math2026.06 | 19 | |
| TreeRLModel=Qwen2.5-7B-Math2026.06 | 18.9 | |
| DAPOModel=Qwen2.5-7B-Math2026.06 | 17.2 | |
| GRPOModel=Qwen2.5-7B-Math2026.06 | 15.5 | |
| BaseModel=Qwen2.5-7B-Math2026.06 | 6.3 |