Mathematical Reasoning on MATH500 (Avg@8, Avg@16, Avg@32)
88.92Accuracy (k=8)GRPO-DBB
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| GRPO-DBBBackbone=Qwen3-8B-Base, Training Dataset=DAPO-Math-17k2026.03 | 88.92 | — | — | |
| GRPOBackbone=Qwen3-8B-Base, Training Dataset=DAPO-Math-17k2026.03 | 88.05 | — | — | |
| RePOBackbone=Qwen3-8B-Base, Training Dataset=DAPO-Math-17k2026.03 | 86.2 | — | — | |
| SENTBackbone=DeepSeek-R1-Distill-Qwen-1.5B2025.12 | 81.48 | 81.74 | 81.22 | |
| w/ ClipBackbone=DeepSeek-R1-Distill-Qwen-1.5B2025.12 | 80.95 | 80.24 | 80.94 | |
| w/ MaskBackbone=DeepSeek-R1-Distill-Qwen-1.5B2025.12 | 80.6 | 80.76 | 81.37 | |
| w/ CovBackbone=DeepSeek-R1-Distill-Qwen-1.5B2025.12 | 80.35 | 80.31 | 79.89 | |
| w/ EnBackbone=DeepSeek-R1-Distill-Qwen-1.5B2025.12 | 79.4 | 79.98 | 79.69 | |
| w/ High EnBackbone=DeepSeek-R1-Distill-Qwen-1.5B2025.12 | 78.85 | 78.86 | 79.57 | |
| Base modelBackbone=DeepSeek-R1-Distill-Qwen-1.5B2025.12 | 77.17 | 77.26 | 76.54 | |
| w/ AdvBackbone=DeepSeek-R1-Distill-Qwen-1.5B2025.12 | 77.02 | 76.6 | 76.83 | |
| GRPOBackbone=DeepSeek-R1-Distill-Qwen-1.5B2025.12 | 73.88 | 73.47 | 73.78 | |
| GRPO-DBBBackbone=Qwen3-1.7B-Base, Training Dataset=DAPO-Math-17k2026.03 | 71.95 | — | — | |
| GRPOBackbone=Qwen3-1.7B-Base, Training Dataset=DAPO-Math-17k2026.03 | 68.37 | — | — | |
| RePOBackbone=Qwen3-1.7B-Base, Training Dataset=DAPO-Math-17k2026.03 | 67.87 | — | — |