Mathematical Reasoning on MATH500 (Accuracy Only)
92.1Accuracy (MATH500)GRPO
Evaluation Results
| Method | Links | |
|---|---|---|
| GRPOTeacher model=Qwen3-30B-A3B-Instruct-25072026.07 | 92.1 | |
| OPDTeacher model=Qwen3-30B-A3B-Instruct-2507, Student model=Qwen3-8B2026.07 | 89 | |
| ReOPDTeacher model=Qwen3-4B-Instruct-2507, Student model=Qwen3-4B-Instruct-25072026.07 | 88.9 | |
| ReOPDTeacher model=Qwen3-30B-A3B-Instruct-2507, Student model=Qwen3-8B2026.07 | 88.4 | |
| OPDTeacher model=Qwen3-4B-Instruct-2507, Student model=Qwen3-4B-Instruct-25072026.07 | 86.9 | |
| ReOPDTeacher model=Qwen3-30B-A3B-Instruct-2507, Student model=Qwen3-4B-Instruct-25072026.07 | 86.5 | |
| OPDTeacher model=Qwen3-8B, Student model=Qwen3-4B-Instruct-25072026.07 | 85.8 | |
| GRPOTeacher model=Qwen3-4B-Instruct-25072026.07 | 85.1 | |
| ReOPDTeacher model=Qwen3-8B, Student model=Qwen3-4B-Instruct-25072026.07 | 84.7 | |
| GRPOTeacher model=Qwen3-8B2026.07 | 84.3 | |
| OPDTeacher model=Qwen3-30B-A3B-Instruct-2507, Student model=Qwen3-4B-Instruct-25072026.07 | 83.8 | |
| Cold StartTeacher model=Qwen3-30B-A3B-Instruct-2507, Student model=Qwen3-8B2026.07 | 82 | |
| SFTTeacher model=Qwen3-4B-Instruct-2507, Student model=Qwen3-4B-Instruct-25072026.07 | 80.9 | |
| SFTTeacher model=Qwen3-8B, Student model=Qwen3-4B-Instruct-25072026.07 | 80.8 | |
| Cold StartTeacher model=Qwen3-4B-Instruct-2507, Student model=Qwen3-4B-Instruct-25072026.07 | 79.1 | |
| BaseTeacher model=Qwen3-30B-A3B-Instruct-2507, Student model=Qwen3-8B2026.07 | 64.8 | |
| BaseTeacher model=Qwen3-4B-Instruct-2507, Student model=Qwen3-4B-Instruct-25072026.07 | 58.2 | |
| LoRA-RLMOBackbone=Qwen2.5-7B-Instruct, Fine-tuning algorithm=GRPO, Training dataset=DAPO-Math-17k, Rank=r=32, Evaluation protocol=pass@4, B0=0, A0=V ⊤ −r2026.06 | 56.73 | |
| LoRA-RLPOBackbone=Qwen2.5-7B-Instruct, Fine-tuning algorithm=GRPO, Training dataset=DAPO-Math-17k, Rank=r=32, Evaluation protocol=pass@4, B0=0, A0=V ⊤ r2026.06 | 55.6 | |
| MiLoRABackbone=Qwen2.5-7B-Instruct, Fine-tuning algorithm=GRPO, Training dataset=DAPO-Math-17k, Rank=r=32, Evaluation protocol=pass@4, B0=U−rΣ 1/2 −r, A0=Σ1/2 −r V ⊤ −r2026.06 | 54.13 | |
| LoRABackbone=Qwen2.5-7B-Instruct, Fine-tuning algorithm=GRPO, Training dataset=DAPO-Math-17k, Rank=r=32, Evaluation protocol=pass@4, B0=0, A0=N (0, 1/n)2026.06 | 52.8 | |
| PiSSABackbone=Qwen2.5-7B-Instruct, Fine-tuning algorithm=GRPO, Training dataset=DAPO-Math-17k, Rank=r=32, Evaluation protocol=pass@4, B0=UrΣ 1/2 r, A0=Σ1/2 r V ⊤ r2026.06 | 50.33 | |
| dOPSDBase Model=Dream-7B-Instruct2026.07 | 42.2 | |
| BaseBase Model=Dream-7B-Instruct2026.07 | 38.97 | |
| GRPOBase Model=Dream-7B-Instruct2026.07 | 37.86 | |
| OPSD (answer-only)Base Model=Dream-7B-Instruct2026.07 | 37.23 | |
| SFTBase Model=Dream-7B-Instruct2026.07 | 36.49 | |
| dOPSDBase Model=LLaDA-8B-Instruct2026.07 | 36 | |
| OPSD (full-solution)Base Model=Dream-7B-Instruct2026.07 | 35.72 | |
| GRPOBase Model=LLaDA-8B-Instruct2026.07 | 32.77 | |
| OPSD (answer-only)Base Model=LLaDA-8B-Instruct2026.07 | 31.45 | |
| BaseBase Model=LLaDA-8B-Instruct2026.07 | 31.24 | |
| SFTBase Model=LLaDA-8B-Instruct2026.07 | 30.12 | |
| OPSD (full-solution)Base Model=LLaDA-8B-Instruct2026.07 | 24.34 |