Mathematical Reasoning on DAPO + MATH
9.6Training Time (hours)DS
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| DSModel backbone=DeepSeek-R1-Distill-Qwen-1.5B, Training steps=1000, Hardware (GPUs)=8x A1002026.03 | 9.6 | 6.1 | 68.7 | 84.4 | |
| HIVEModel backbone=DeepSeek-R1-Distill-Qwen-1.5B, Training steps=1000, Hardware (GPUs)=8x A1002026.03 | 10.1 | 6.7 | 42.7 | 59.5 | |
| GRESOModel backbone=DeepSeek-R1-Distill-Qwen-1.5B, Training steps=1000, Hardware (GPUs)=8x A1002026.03 | 10.4 | 6.6 | 45.9 | 62.9 | |
| DSModel backbone=Qwen2.5-Math-1.5B, Training steps=1000, Hardware (GPUs)=8x A1002026.03 | 10.9 | 6 | 77.3 | 94.2 | |
| HIVEModel backbone=Qwen2.5-Math-1.5B, Training steps=1000, Hardware (GPUs)=8x A1002026.03 | 11.2 | 6.2 | 42.1 | 59.5 | |
| GRESOModel backbone=Qwen2.5-Math-1.5B, Training steps=1000, Hardware (GPUs)=8x A1002026.03 | 11.3 | 6.4 | 46 | 63.7 | |
| DSModel backbone=Llama3.2-3b-Instruct, Training steps=1000, Hardware (GPUs)=8x A1002026.03 | 20.6 | 10.2 | 218.3 | 249.1 | |
| GRESOModel backbone=Llama3.2-3b-Instruct, Training steps=1000, Hardware (GPUs)=8x A1002026.03 | 21.8 | 10.5 | 116.5 | 148.8 | |
| HIVEModel backbone=Llama3.2-3b-Instruct, Training steps=1000, Hardware (GPUs)=8x A1002026.03 | 22.2 | 10.6 | 90.4 | 123.2 | |
| DSModel backbone=Qwen2.5-Math-7B, Training steps=1000, Hardware (GPUs)=8x A1002026.03 | 32.1 | 12.6 | 153.7 | 198.4 | |
| HIVEModel backbone=Qwen2.5-Math-7B, Training steps=1000, Hardware (GPUs)=8x A1002026.03 | 32.7 | 12.9 | 40.2 | 85.8 | |
| GRESOModel backbone=Qwen2.5-Math-7B, Training steps=1000, Hardware (GPUs)=8x A1002026.03 | 32.8 | 13.2 | 66.3 | 112.3 |