Mathematical Reasoning on MATH 500 (pass@1, Avg)
96.6Pass@1 RateQwen3-4B-LambdaGRPO
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Qwen3-4B-LambdaGRPOModel Architecture=Qwen3, Model Size=4B, Training Algorithm=LambdaGRPO2026.05 | 96.6 | 76.49 | — | |
| Qwen3-4B-GRPOModel Architecture=Qwen3, Model Size=4B, Training Algorithm=GRPO2026.05 | 96.35 | 75.4 | — | |
| Qwen3-4BModel Architecture=Qwen3, Model Size=4B2026.05 | 95.6 | 73.18 | — | |
| REAPModel=GLM-4.5-Air, Compression=25%, Technique=Pruning2025.10 | 92 | 0.879 | — | |
| BaselineModel=GLM-4.5-Air, Compression=Baseline2025.10 | 91.8 | 0.882 | — | |
| Phi-4-mini-LambdaGRPOModel Architecture=Phi-4, Model Size=mini, Training Algorithm=LambdaGRPO2026.05 | 91.05 | 56.38 | — | |
| HC-SMoEModel=GLM-4.5-Air, Compression=25%, Technique=Merging2025.10 | 90.8 | 0.875 | — | |
| FrequencyModel=GLM-4.5-Air, Compression=25%, Technique=Pruning2025.10 | 90.8 | 0.87 | — | |
| EANModel=GLM-4.5-Air, Compression=25%, Technique=Pruning2025.10 | 90.8 | 0.874 | — | |
| Qwen3-1.7B-temp1.5Model Architecture=Qwen3, Model Size=1.7B, Training Algorithm=LambdaPO, Temperature (tau)=1.52026.05 | 90.2 | 53.03 | — | |
| REAPModel=GLM-4.5-Air, Compression=50%, Technique=Pruning2025.10 | 90 | 0.857 | — | |
| Qwen3-1.7B-temp2Model Architecture=Qwen3, Model Size=1.7B, Training Algorithm=LambdaPO, Temperature (tau)=2.02026.05 | 89.8 | 52.04 | — | |
| Phi-4-mini-GRPOModel Architecture=Phi-4, Model Size=mini, Training Algorithm=GRPO2026.05 | 89.8 | 55.35 | — | |
| Qwen3-1.7B-temp0.1Model Architecture=Qwen3, Model Size=1.7B, Training Algorithm=LambdaPO, Temperature (tau)=0.12026.05 | 89.6 | 51.38 | — | |
| Qwen3-1.7B-temp5Model Architecture=Qwen3, Model Size=1.7B, Training Algorithm=LambdaPO, Temperature (tau)=5.02026.05 | 89.6 | 51.74 | — | |
| Qwen3-1.7B-temp0.5Model Architecture=Qwen3, Model Size=1.7B, Training Algorithm=LambdaPO, Temperature (tau)=0.52026.05 | 89.4 | 51.87 | — | |
| Qwen3-1.7B-base-grpoModel Architecture=Qwen3, Model Size=1.7B, Training Algorithm=GRPO2026.05 | 89.3 | 51.42 | — | |
| Phi-4-miniModel Architecture=Phi-4, Model Size=mini2026.05 | 89.2 | 54.08 | — | |
| Qwen3-1.7BModel Architecture=Qwen3, Model Size=1.7B2026.05 | 89.05 | 50.86 | — | |
| Qwen3-1.7B-temp1Model Architecture=Qwen3, Model Size=1.7B, Training Algorithm=LambdaPO, Temperature (tau)=1.02026.05 | 89.05 | 52.09 | — | |
| OPDTeacher-Student Setting=DeepSeek-R1 -> DeepSeek-R1-Distill-Qwen-7B2026.06 | 89 | — | — | |
| LoRA-αModel=7B2026.06 | 88.6 | — | — | |
| REAPModel=Qwen3-30B-A3B, Compression=25%, Technique=Pruning2025.10 | 88.1 | 0.888 | — | |
| M-SMoEModel=GLM-4.5-Air, Compression=25%, Technique=Merging2025.10 | 88 | 0.864 | — | |
| ALMTeacher-Student Setting=DeepSeek-R1 -> DeepSeek-R1-Distill-Qwen-7B2026.06 | 88 | — | — | |
| EANModel=Qwen3-30B-A3B, Compression=25%, Technique=Pruning2025.10 | 87.9 | 0.892 | — | |
| CDMTeacher-Student Setting=DeepSeek-R1 -> DeepSeek-R1-Distill-Qwen-7B2026.06 | 87.8 | — | — | |
| LoRA (10× LR)Model=7B2026.06 | 87.6 | — | — | |
| SFTTeacher-Student Setting=DeepSeek-R1 -> DeepSeek-R1-Distill-Qwen-7B2026.06 | 87.4 | — | — | |
| BaselineModel=Qwen3-30B-A3B, Compression=Baseline2025.10 | 87.2 | 0.887 | — | |
| M-SMoEModel=Qwen3-30B-A3B, Compression=25%, Technique=Merging2025.10 | 87.2 | 0.886 | — | |
| LoRAModel=7B2026.06 | 87.2 | — | — | |
| Base modelModel=7B2026.06 | 86.6 | — | — | |
| FrequencyModel=Qwen3-30B-A3B, Compression=25%, Technique=Pruning2025.10 | 86.5 | 0.888 | — | |
| FrequencyModel=Qwen3-30B-A3B, Compression=50%, Technique=Pruning2025.10 | 86 | 0.865 | — | |
| EANModel=Qwen3-30B-A3B, Compression=50%, Technique=Pruning2025.10 | 85.5 | 0.864 | — | |
| +CurES-GRPOBase Model=Qwen2.5-Math-7B, Training Method=CurES-GRPO2025.10 | 84.8 | 52.41 | — | |
| M-SMoEModel=Qwen3-30B-A3B, Compression=50%, Technique=Merging2025.10 | 83.8 | 0.831 | — | |
| REAPModel=Qwen3-30B-A3B, Compression=50%, Technique=Pruning2025.10 | 83.8 | 0.857 | — | |
| EANModel=GLM-4.5-Air, Compression=50%, Technique=Pruning2025.10 | 83.8 | 0.809 | — | |
| HC-SMoEModel=Qwen3-30B-A3B, Compression=25%, Technique=Merging2025.10 | 83.4 | 0.849 | — | |
| +Speed-RL-GRPOBase Model=Qwen2.5-Math-7B, Training Method=Speed-RL-GRPO2025.10 | 82.8 | 48.84 | — | |
| OPDTeacher-Student Setting=Qwen3-8B -> Llama3.1-8B-SFT2026.06 | 82.6 | — | — | |
| Full Fine-TuningModel=1.5B2026.06 | 82 | — | — | |
| +CurES-RPPBase Model=Qwen2.5-Math-7B, Training Method=CurES-RPP2025.10 | 81.8 | 49.62 | — | |
| +GVM-GRPOBase Model=Qwen2.5-Math-7B, Training Method=GVM-GRPO2025.10 | 81.6 | 50.64 | — | |
| +GVM-RPPBase Model=Qwen2.5-Math-7B, Training Method=GVM-RPP2025.10 | 81.6 | 46.95 | — | |
| CDMTeacher-Student Setting=Qwen3-8B -> Llama3.1-8B-SFT2026.06 | 81.4 | — | — | |
| +RPPBase Model=Qwen2.5-Math-7B, Training Method=RPP2025.10 | 81.2 | 50.18 | — | |
| ALMTeacher-Student Setting=Qwen3-8B -> Llama3.1-8B-SFT2026.06 | 81.2 | — | — | |
| SFTTeacher-Student Setting=Qwen3-8B -> Llama3.1-8B-SFT2026.06 | 80.8 | — | — | |
| +GRPOBase Model=Qwen2.5-Math-7B, Training Method=GRPO2025.10 | 80 | 47.59 | — | |
| LoRA-αModel=1.5B2026.06 | 79.8 | — | — | |
| BASESolver=Gemini 3 Pro, K=82026.06 | 79.4 | — | 98.7 | |
| +Speed-RL-RPPBase Model=Qwen2.5-Math-7B, Training Method=Speed-RL-RPP2025.10 | 78.6 | 49.56 | — | |
| +CurES-GRPOBase Model=Qwen2.5-Math-1.5B, Training Method=CurES-GRPO2025.10 | 77.2 | 44.94 | — | |
| +GVM-RPPBase Model=Qwen2.5-Math-1.5B, Training Method=GVM-RPP2025.10 | 75.4 | 42.21 | — | |
| +CurES-RPPBase Model=Qwen2.5-Math-1.5B, Training Method=CurES-RPP2025.10 | 75.4 | 44.14 | — | |
| +GVM-GRPOBase Model=Qwen2.5-Math-1.5B, Training Method=GVM-GRPO2025.10 | 74.8 | 42.82 | — | |
| +GRPOBase Model=Qwen2.5-Math-1.5B, Training Method=GRPO2025.10 | 73.8 | 41.64 | — | |
| HC-SMoEModel=GLM-4.5-Air, Compression=50%, Technique=Merging2025.10 | 73.2 | 0.7 | — | |
| Independent FormalizationSolver=Gemini 3 Pro, K=82026.06 | 70.2 | — | 87.3 | |
| HC-SMoEModel=Qwen3-30B-A3B, Compression=50%, Technique=Merging2025.10 | 69.6 | 0.728 | — | |
| +Speed-RL-GRPOBase Model=Qwen2.5-Math-1.5B, Training Method=Speed-RL-GRPO2025.10 | 68.8 | 41.34 | — | |
| BASESolver=R1-Qwen3-8B, K=82026.06 | 67.5 | — | 98.8 | |
| +Speed-RL-RPPBase Model=Qwen2.5-Math-1.5B, Training Method=Speed-RL-RPP2025.10 | 65.8 | 41.75 | — | |
| +RPPBase Model=Qwen2.5-Math-1.5B, Training Method=RPP2025.10 | 64.8 | 35.86 | — | |
| FrequencyModel=GLM-4.5-Air, Compression=50%, Technique=Pruning2025.10 | 61.2 | 0.613 | — | |
| Qwen2.5-Math-7BBase Model=Qwen2.5-Math-7B, Training Method=Base2025.10 | 60.2 | 33.48 | — | |
| Independent FormalizationSolver=R1-Qwen3-8B, K=82026.06 | 58.7 | — | 85.4 | |
| BASESolver=Qwen3-8B, K=82026.06 | 51.2 | — | 96.3 | |
| LLaDA + DreamEnsemble Type=Intermediate-generation Ensemble, Scoring Function=Token change count2026.06 | 48.6 | — | — | |
| LLaDA + DreamEnsemble Type=Intermediate-generation Ensemble, Scoring Function=Probability margin2026.06 | 48.4 | — | — | |
| DreamEnsemble Type=Single Model2026.06 | 48 | — | — | |
| LLaDA + DreamEnsemble Type=Intermediate-generation Ensemble, Scoring Function=Top-1 probability2026.06 | 47 | — | — | |
| M-SMoEModel=GLM-4.5-Air, Compression=50%, Technique=Merging2025.10 | 46.6 | 0.465 | — | |
| Independent FormalizationSolver=Qwen3-8B, K=82026.06 | 45.7 | — | 88.2 | |
| StableDRLSeq Len=2562026.03 | 45.2 | — | — | |
| LLaDA + DreamEnsemble Type=Intermediate-generation Ensemble, Scoring Function=Entropy2026.06 | 45.2 | — | — | |
| StableDRLSeq Len=5122026.03 | 44 | — | — | |
| ESPOSeq Len=5122026.03 | 43.4 | — | — | |
| LLaDA + DreamEnsemble Type=Post-generation Ensemble2026.06 | 43 | — | — | |
| Full Fine-TuningModel=7B2026.06 | 42.65 | — | — | |
| SPG w/ MixtureSeq Len=5122026.03 | 41.8 | — | — | |
| Qwen2.5-Math-1.5BBase Model=Qwen2.5-Math-1.5B, Training Method=Base2025.10 | 40.2 | 20 | — | |
| SPG w/ MixtureSeq Len=2562026.03 | 40 | — | — | |
| SCRLBackbone=Llama-3.2-1B-Instruct2026.03 | 39.7 | 23.2 | — | |
| D1Seq Len=5122026.03 | 39.4 | — | — | |
| UniGRPOSeq Len=5122026.03 | 39.4 | — | — | |
| WD1Seq Len=5122026.03 | 39 | — | — | |
| ESPOSeq Len=2562026.03 | 39 | — | — | |
| WD1Seq Len=2562026.03 | 37.4 | — | — | |
| UniGRPOSeq Len=2562026.03 | 37.4 | — | — | |
| LLaDAEnsemble Type=Single Model2026.06 | 37.4 | — | — | |
| StableDRLSeq Len=1282026.03 | 36.2 | — | — | |
| D1Seq Len=2562026.03 | 36 | — | — | |
| ESPOSeq Len=1282026.03 | 36 | — | — | |
| LLaDA-1.5Seq Len=5122026.03 | 35.8 | — | — | |
| LLaDA-8B-Inst.Seq Len=5122026.03 | 34.6 | — | — | |
| SPG w/ MixtureSeq Len=1282026.03 | 33.4 | — | — |