Mathematical Reasoning on OlympiadBench OE_TO_mat_en_COMP
57.73AccuracyDiPO
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| DiPOBackbone=Qwen3-8B-Base2026.04 | 57.73 | 57.73 | |
| DAPO w/ ELBackbone=Qwen3-8B-Base2026.04 | 57.21 | 57.21 | |
| CDEBackbone=Qwen3-8B-Base2026.04 | 57.11 | 57.11 | |
| DAPOBackbone=Qwen3-8B-Base2026.04 | 56.9 | 56.9 | |
| GRPOBackbone=Qwen3-8B-Base2026.04 | 56.2 | 56.2 | |
| DAPO w/ ELBackbone=Qwen3-4B-Base2026.04 | 54.53 | 54.53 | |
| DiPOBackbone=Qwen3-4B-Base2026.04 | 54.09 | 54.09 | |
| DAPOBackbone=Qwen3-4B-Base2026.04 | 53.88 | 53.88 | |
| GRPOBackbone=Qwen3-4B-Base2026.04 | 53.06 | 53.06 | |
| CDEBackbone=Qwen3-4B-Base2026.04 | 52.25 | 52.25 | |
| DiPOBackbone=Qwen2.5-7B2026.04 | 43.72 | 43.72 | |
| DAPO w/ ELBackbone=Qwen2.5-7B2026.04 | 43.05 | 43.05 | |
| CDEBackbone=Qwen2.5-7B2026.04 | 42.94 | 42.94 | |
| DAPOBackbone=Qwen2.5-7B2026.04 | 42.7 | 42.7 | |
| GRPOBackbone=Qwen2.5-7B2026.04 | 42.42 | 42.42 | |
| Base modelBackbone=Qwen3-8B-Base2026.04 | 33.3 | 33.3 | |
| Base modelBackbone=Qwen3-4B-Base2026.04 | 25.52 | 25.52 | |
| Base modelBackbone=Qwen2.5-7B2026.04 | 19.28 | 19.28 |