Reasoning on Hybrid Reasoning Dataset
61.6Math Average ScoreQwen2.5-14B
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| Qwen2.5-14BModel Size=14B, Base Model=Qwen2.5-Instruct, RL Training Algorithm=None2026.05 | 61.6 | 56.7 | 53.2 | 68.8 | 60.1 | |
| DAPO + HistaModel Size=14B, Base Model=Qwen2.5-Instruct, RL Training Algorithm=DAPO + Hista2026.05 | 61.2 | 57.4 | 55.6 | 69.8 | 61 | |
| DAPOModel Size=14B, Base Model=Qwen2.5-Instruct, RL Training Algorithm=DAPO2026.05 | 60.1 | 56.7 | 54.6 | 69.8 | 60.3 | |
| DAPO + HistaModel Size=7B, Base Model=Qwen2.5-Instruct, RL Training Algorithm=DAPO + Hista2026.05 | 59 | 51.5 | 46.1 | 68.6 | 56.3 | |
| Qwen2.5-7BModel Size=7B, Base Model=Qwen2.5-Instruct, RL Training Algorithm=None2026.05 | 57.6 | 48.3 | 45.7 | 68.1 | 54.9 | |
| CSIPO + HistaModel Size=7B, Base Model=Qwen2.5-Instruct, RL Training Algorithm=CSIPO + Hista2026.05 | 57.2 | 52 | 45.8 | 68.7 | 55.9 | |
| CSIPOModel Size=7B, Base Model=Qwen2.5-Instruct, RL Training Algorithm=CSIPO2026.05 | 56.6 | 51.7 | 45.3 | 69.1 | 55.7 | |
| DAPOModel Size=7B, Base Model=Qwen2.5-Instruct, RL Training Algorithm=DAPO2026.05 | 56.5 | 50 | 44.4 | 70 | 55.2 | |
| CSIPO + HistaModel Size=3B, Base Model=Qwen2.5-Instruct, RL Training Algorithm=CSIPO + Hista2026.05 | 50.4 | 44.3 | 37.1 | 61 | 48.2 | |
| CSIPOModel Size=3B, Base Model=Qwen2.5-Instruct, RL Training Algorithm=CSIPO2026.05 | 49.5 | 45.3 | 36.8 | 60.1 | 47.9 | |
| DAPO + HistaModel Size=3B, Base Model=Qwen2.5-Instruct, RL Training Algorithm=DAPO + Hista2026.05 | 49.2 | 44 | 37.1 | 59.2 | 47.4 | |
| Qwen2.5-3BModel Size=3B, Base Model=Qwen2.5-Instruct, RL Training Algorithm=None2026.05 | 48.3 | 43.1 | 35.9 | 59.7 | 46.8 | |
| DAPOModel Size=3B, Base Model=Qwen2.5-Instruct, RL Training Algorithm=DAPO2026.05 | 47 | 42.5 | 36.1 | 58.4 | 46 | |
| CSIPO + HistaModel Size=1.5B, Base Model=Qwen2.5-Instruct, RL Training Algorithm=CSIPO + Hista2026.05 | 41.5 | 37.2 | 30 | 54.6 | 40.8 | |
| CSIPOModel Size=1.5B, Base Model=Qwen2.5-Instruct, RL Training Algorithm=CSIPO2026.05 | 40.4 | 36.1 | 26 | 53.9 | 39.1 | |
| DAPO + HistaModel Size=1.5B, Base Model=Qwen2.5-Instruct, RL Training Algorithm=DAPO + Hista2026.05 | 40.1 | 36.6 | 29.5 | 53.4 | 39.9 | |
| Qwen2.5-1.5BModel Size=1.5B, Base Model=Qwen2.5-Instruct, RL Training Algorithm=None2026.05 | 39.3 | 34.9 | 26.8 | 53.5 | 38.6 | |
| DAPOModel Size=1.5B, Base Model=Qwen2.5-Instruct, RL Training Algorithm=DAPO2026.05 | 38.4 | 35.8 | 29 | 52.7 | 38.9 |