Mathematical Reasoning on GSM8K (test) (Accuracy, Tokens, Training Time, Speedup)
76.85AccuracyCPPO
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| CPPOGroup Size G=16, base_model=Qwen2.5-1.5B-Instruct2026.05 | 76.85 | 265.7 | -1.2 | 2,541 | 4.65 | |
| GRPOGroup Size G=16, base_model=Qwen2.5-1.5B-Instruct2026.05 | 76.57 | 262.64 | — | 11,816 | 1 | |
| GRPO+FIRSTNGroup Size G=16, base_model=Qwen2.5-1.5B-Instruct2026.05 | 76.55 | 253.17 | 3.6 | 11,197 | 1.06 | |
| PairGroup Size G=16, base_model=Qwen2.5-1.5B-Instruct2026.05 | 76.48 | 161.03 | 38.7 | 2,271 | 5.2 | |
| PairGroup Size G=8, base_model=Qwen2.5-1.5B-Instruct2026.05 | 76.24 | 177.21 | 31.6 | 2,008 | 3.58 | |
| BPPOGroup Size G=16, base_model=Qwen2.5-1.5B-Instruct2026.05 | 75.92 | 147.25 | 43.9 | 2,002 | 5.9 | |
| GRPO+FIRSTNGroup Size G=8, base_model=Qwen2.5-1.5B-Instruct2026.05 | 75.84 | 232.01 | 10.4 | 6,002 | 1.2 | |
| GRPOGroup Size G=8, base_model=Qwen2.5-1.5B-Instruct2026.05 | 75.65 | 259.05 | — | 7,186 | 1 | |
| CPPOGroup Size G=8, base_model=Qwen2.5-1.5B-Instruct2026.05 | 75.5 | 285.72 | -10.3 | 2,361 | 3.04 | |
| BPPOGroup Size G=8, base_model=Qwen2.5-1.5B-Instruct2026.05 | 75.34 | 155.06 | 40.1 | 1,812 | 3.97 | |
| Qwen2.5-1.5B-Instructbase_model=Qwen2.5-1.5B-Instruct2026.05 | 23.63 | — | — | — | — |