Mathematical Reasoning on Minerva (Pass@8, Pass@16, Pass@32)
39.48Pass@8GRPO-DBB
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| GRPO-DBBBackbone=Qwen3-8B-Base, Training Dataset=DAPO-Math-17k2026.03 | 39.48 | — | — | |
| GRPOBackbone=Qwen3-8B-Base, Training Dataset=DAPO-Math-17k2026.03 | 39.25 | — | — | |
| SENTBackbone=DeepSeek-R1-Distill-Qwen-1.5B2025.12 | 37.5 | 42.65 | 46.32 | |
| w/ CovBackbone=DeepSeek-R1-Distill-Qwen-1.5B2025.12 | 36.76 | 40.44 | 43.01 | |
| RePOBackbone=Qwen3-8B-Base, Training Dataset=DAPO-Math-17k2026.03 | 35.71 | — | — | |
| w/ MaskBackbone=DeepSeek-R1-Distill-Qwen-1.5B2025.12 | 34.93 | 38.97 | 45.59 | |
| w/ EnBackbone=DeepSeek-R1-Distill-Qwen-1.5B2025.12 | 34.56 | 41.91 | 45.59 | |
| w/ AdvBackbone=DeepSeek-R1-Distill-Qwen-1.5B2025.12 | 34.56 | 37.13 | 40.44 | |
| w/ High EnBackbone=DeepSeek-R1-Distill-Qwen-1.5B2025.12 | 34.56 | 41.18 | 45.22 | |
| Base modelBackbone=DeepSeek-R1-Distill-Qwen-1.5B2025.12 | 33.82 | 36.76 | 41.54 | |
| w/ ClipBackbone=DeepSeek-R1-Distill-Qwen-1.5B2025.12 | 33.09 | 38.6 | 44.49 | |
| GRPOBackbone=DeepSeek-R1-Distill-Qwen-1.5B2025.12 | 32.72 | 36.03 | 39.71 | |
| Prompt-GDROBackbone=Qwen3-8B-Base2026.01 | 32.17 | — | — | |
| Rollout-GDROBackbone=Qwen3-8B-Base2026.01 | 29.55 | — | — | |
| GRPO (Baseline)Backbone=Qwen3-8B-Base2026.01 | 28.17 | — | — | |
| Prompt-GDROBackbone=Qwen3-4B-Base2026.01 | 26.72 | — | — | |
| Rollout-GDROBackbone=Qwen3-4B-Base2026.01 | 26.47 | — | — | |
| GRPO-DBBBackbone=Qwen3-1.7B-Base, Training Dataset=DAPO-Math-17k2026.03 | 26.31 | — | — | |
| GRPOBackbone=Qwen3-1.7B-Base, Training Dataset=DAPO-Math-17k2026.03 | 25.74 | — | — | |
| RePOBackbone=Qwen3-1.7B-Base, Training Dataset=DAPO-Math-17k2026.03 | 23.76 | — | — | |
| GRPO (Baseline)Backbone=Qwen3-4B-Base2026.01 | 17.79 | — | — | |
| Rollout-GDROBackbone=Qwen3-1.7B-Base2026.01 | 17.28 | — | — | |
| Prompt-GDROBackbone=Qwen3-1.7B-Base2026.01 | 14.61 | — | — | |
| GRPO (Baseline)Backbone=Qwen3-1.7B-Base2026.01 | 14.56 | — | — | |
| DPSK-R1-Distill-1.5BBase Model=DPSK-R1-Distill-1.5B, Training Algorithm=None2026.03 | — | 22.9 | — | |
| GRPOBase Model=DPSK-R1-Distill-1.5B, Training Algorithm=GRPO2026.03 | — | 27.6 | — | |
| GRPOBase Model=Qwen2.5-Math-7B, Training Algorithm=GRPO2026.03 | — | 30.8 | — | |
| Qwen2.5-Math-7BBase Model=Qwen2.5-Math-7B, Training Algorithm=None2026.03 | — | 10.9 | — | |
| ReValBase Model=DPSK-R1-Distill-1.5B, Training Algorithm=ReVal2026.03 | — | 30.3 | — | |
| ReValBase Model=Qwen2.5-Math-7B, Training Algorithm=ReVal2026.03 | — | 30.7 | — | |
| TBRMBase Model=DPSK-R1-Distill-1.5B, Training Algorithm=TBRM2026.03 | — | 28.8 | — | |
| TBRMBase Model=Qwen2.5-Math-7B, Training Algorithm=TBRM2026.03 | — | 27.3 | — |