Mathematical Reasoning on AIME 2024 (Accuracy, Average)
76.49Average ScoreQwen3-4B-LambdaGRPO
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Qwen3-4B-LambdaGRPOModel Architecture=Qwen3, Model Size=4B, Training Algorithm=LambdaGRPO2026.05 | 76.49 | 73.33 | |
| Qwen3-4B-GRPOModel Architecture=Qwen3, Model Size=4B, Training Algorithm=GRPO2026.05 | 75.4 | 71.67 | |
| Qwen3-4BModel Architecture=Qwen3, Model Size=4B2026.05 | 73.18 | 69.95 | |
| Phi-4-mini-LambdaGRPOModel Architecture=Phi-4, Model Size=mini, Training Algorithm=LambdaGRPO2026.05 | 56.38 | 47.71 | |
| Phi-4-mini-GRPOModel Architecture=Phi-4, Model Size=mini, Training Algorithm=GRPO2026.05 | 55.35 | 48.33 | |
| Phi-4-miniModel Architecture=Phi-4, Model Size=mini2026.05 | 54.08 | 46.67 | |
| TREK (DeepSeek-V4)Stage=TREK (DeepSeek-V4), Model=Qwen3-14B2026.07 | 53.8 | — | |
| Qwen3-1.7B-temp1.5Model Architecture=Qwen3, Model Size=1.7B, Training Algorithm=LambdaPO, Temperature (tau)=1.52026.05 | 53.03 | 46.67 | |
| Qwen3-1.7B-temp1Model Architecture=Qwen3, Model Size=1.7B, Training Algorithm=LambdaPO, Temperature (tau)=1.02026.05 | 52.09 | 44.51 | |
| Qwen3-1.7B-temp2Model Architecture=Qwen3, Model Size=1.7B, Training Algorithm=LambdaPO, Temperature (tau)=2.02026.05 | 52.04 | 45 | |
| Qwen3-1.7B-temp0.5Model Architecture=Qwen3, Model Size=1.7B, Training Algorithm=LambdaPO, Temperature (tau)=0.52026.05 | 51.87 | 43.33 | |
| Qwen3-1.7B-temp5Model Architecture=Qwen3, Model Size=1.7B, Training Algorithm=LambdaPO, Temperature (tau)=5.02026.05 | 51.74 | 44.17 | |
| Qwen3-1.7B-base-grpoModel Architecture=Qwen3, Model Size=1.7B, Training Algorithm=GRPO2026.05 | 51.42 | 42.08 | |
| Qwen3-1.7B-temp0.1Model Architecture=Qwen3, Model Size=1.7B, Training Algorithm=LambdaPO, Temperature (tau)=0.12026.05 | 51.38 | 44.17 | |
| TREK (DeepSeek-V4)Stage=TREK (DeepSeek-V4), Model=Qwen3-8B2026.07 | 51.1 | — | |
| Qwen3-1.7BModel Architecture=Qwen3, Model Size=1.7B2026.05 | 50.86 | 41.52 | |
| TREK (self-context)Stage=TREK (self-context), Model=Qwen3-14B2026.07 | 50.2 | — | |
| TREK (self-context)Stage=TREK (self-context), Model=Qwen3-8B2026.07 | 49.6 | — | |
| OPD (self-context)Stage=OPD (self-context), Model=Qwen3-14B2026.07 | 48.6 | — | |
| OPD (self-context)Stage=OPD (self-context), Model=Qwen3-8B2026.07 | 48.4 | — | |
| Direct GRPOStage=Direct GRPO, Model=Qwen3-8B2026.07 | 47.9 | — | |
| Direct GRPOStage=Direct GRPO, Model=Qwen3-14B2026.07 | 47.4 | — | |
| TREK (DeepSeek-V4)Stage=TREK (DeepSeek-V4), Model=Qwen3-1.7B2026.07 | 25.6 | — | |
| TREK (self-context)Stage=TREK (self-context), Model=Qwen3-1.7B2026.07 | 22.4 | — | |
| OPD (self-context)Stage=OPD (self-context), Model=Qwen3-1.7B2026.07 | 21.3 | — | |
| Direct GRPOStage=Direct GRPO, Model=Qwen3-1.7B2026.07 | 20.2 | — | |
| LoRABackbone=Qwen2.5-7B-Instruct, Fine-tuning algorithm=GRPO, Training dataset=DAPO-Math-17k, Rank=r=32, Evaluation protocol=pass@16, B0=0, A0=N (0, 1/n)2026.06 | — | 5.56 | |
| LoRA-RLMOBackbone=Qwen2.5-7B-Instruct, Fine-tuning algorithm=GRPO, Training dataset=DAPO-Math-17k, Rank=r=32, Evaluation protocol=pass@16, B0=0, A0=V ⊤ −r2026.06 | — | 13.33 | |
| LoRA-RLPOBackbone=Qwen2.5-7B-Instruct, Fine-tuning algorithm=GRPO, Training dataset=DAPO-Math-17k, Rank=r=32, Evaluation protocol=pass@16, B0=0, A0=V ⊤ r2026.06 | — | 17.78 | |
| MiLoRABackbone=Qwen2.5-7B-Instruct, Fine-tuning algorithm=GRPO, Training dataset=DAPO-Math-17k, Rank=r=32, Evaluation protocol=pass@16, B0=U−rΣ 1/2 −r, A0=Σ1/2 −r V ⊤ −r2026.06 | — | 8.89 | |
| PiSSABackbone=Qwen2.5-7B-Instruct, Fine-tuning algorithm=GRPO, Training dataset=DAPO-Math-17k, Rank=r=32, Evaluation protocol=pass@16, B0=UrΣ 1/2 r, A0=Σ1/2 r V ⊤ r2026.06 | — | 6.67 |