Mathematical Reasoning on AIME 25 (pass@2, pass@4, pass@8, pass@16)
42.07Pass@16S-trace-0.9
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| S-trace-0.9Backbone=Qwen3-8B2026.05 | 42.07 | — | — | — | |
| GRPOBackbone=Qwen3-8B2026.05 | 38.81 | — | — | — | |
| GRPO(λ)-0.9Backbone=Qwen3-8B2026.05 | 38.62 | — | — | — | |
| Qwen2.5-7B-ERPOParameter Scale=7B, Training Strategy=ERPO2026.03 | 36.67 | 12.08 | 18.6 | 26.44 | |
| DeepSeek-R1-671B-0528Parameter Scale=671B, Training Strategy=Commercial Baseline2026.03 | 33.33 | 17.33 | 23.68 | 28.82 | |
| Qwen2.5-7B-GRPOParameter Scale=7B, Training Strategy=GRPO2026.03 | 33.33 | 10.97 | 16.93 | 24.29 | |
| Qwen2.5-3B-GRPOParameter Scale=3B, Training Strategy=GRPO2026.03 | 30 | 6.31 | 11.4 | 19.29 | |
| Qwen3-235B-A22B-Instr.Parameter Scale=235B, Training Strategy=Commercial Baseline2026.03 | 26.67 | 20.03 | 22.21 | 24.22 | |
| Qwen2.5-1.5B-GRPOParameter Scale=1.5B, Training Strategy=GRPO2026.03 | 26.67 | 4.11 | 8 | 15.11 | |
| Qwen2.5-3B-ERPOParameter Scale=3B, Training Strategy=ERPO2026.03 | 23.33 | 5.56 | 10.07 | 16.56 | |
| Qwen2.5-7B-BaseParameter Scale=7B, Training Strategy=Base2026.03 | 20 | 2.5 | 5 | 10 | |
| OPOBackbone=Qwen3-1.7B2026.05 | 20 | — | — | — | |
| Qwen2.5-7B-SFTParameter Scale=7B, Training Strategy=SFT2026.03 | 16.67 | 2.83 | 5.36 | 9.67 | |
| GRPO(λ)-0.99Backbone=Qwen3-1.7B2026.05 | 16.67 | — | — | — | |
| S-trace-0.9Backbone=Qwen3-1.7B2026.05 | 16.67 | — | — | — | |
| Qwen2.5-1.5B-ERPOParameter Scale=1.5B, Training Strategy=ERPO2026.03 | 13.33 | 3.72 | 6.12 | 9.21 | |
| Qwen2.5-3B-SFTParameter Scale=3B, Training Strategy=SFT2026.03 | 13.33 | 1.67 | 3.33 | 6.67 | |
| GRPOBackbone=Qwen3-1.7B2026.05 | 13.33 | — | — | — | |
| Qwen2.5-3B-BaseParameter Scale=3B, Training Strategy=Base2026.03 | 10 | 2.72 | 4.76 | 7.43 | |
| GRPO(λ)-0.9Backbone=Qwen3-1.7B2026.05 | 10 | — | — | — | |
| Qwen2.5-1.5B-SFTParameter Scale=1.5B, Training Strategy=SFT2026.03 | 6.67 | 0.83 | 1.67 | 3.33 | |
| Qwen2.5-1.5B-BaseParameter Scale=1.5B, Training Strategy=Base2026.03 | 0 | 0 | 0 | 0 | |
| GRPOModel=Llama-3.1-8B2026.05 | — | — | — | 6.67 | |
| GRPOModel=DeepSeek-Math-7B2026.05 | — | — | — | 16.67 | |
| POPOModel=Llama-3.1-8B2026.05 | — | — | — | 10 | |
| POPOModel=DeepSeek-Math-7B2026.05 | — | — | — | 20 |