Reasoning on GPQA Diamond (Accuracy, Average)
68.94AccuracyQwen3-4B-LambdaGRPO
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Qwen3-4B-LambdaGRPOModel Architecture=Qwen3, Model Size=4B, Training Algorithm=LambdaGRPO2026.05 | 68.94 | 76.49 | |
| Qwen3-4B-GRPOModel Architecture=Qwen3, Model Size=4B, Training Algorithm=GRPO2026.05 | 67.74 | 75.4 | |
| Qwen3-4BModel Architecture=Qwen3, Model Size=4B2026.05 | 67.17 | 73.18 | |
| Phi-4-mini-LambdaGRPOModel Architecture=Phi-4, Model Size=mini, Training Algorithm=LambdaGRPO2026.05 | 48.44 | 56.38 | |
| Phi-4-mini-GRPOModel Architecture=Phi-4, Model Size=mini, Training Algorithm=GRPO2026.05 | 46.59 | 55.35 | |
| Phi-4-miniModel Architecture=Phi-4, Model Size=mini2026.05 | 45.33 | 54.08 | |
| Qwen3-1.7B-temp1Model Architecture=Qwen3, Model Size=1.7B, Training Algorithm=LambdaPO, Temperature (tau)=1.02026.05 | 42.91 | 52.09 | |
| Qwen3-1.7B-temp5Model Architecture=Qwen3, Model Size=1.7B, Training Algorithm=LambdaPO, Temperature (tau)=5.02026.05 | 42.42 | 51.74 | |
| Qwen3-1.7B-temp1.5Model Architecture=Qwen3, Model Size=1.7B, Training Algorithm=LambdaPO, Temperature (tau)=1.52026.05 | 41.92 | 53.03 | |
| Qwen3-1.7B-temp2Model Architecture=Qwen3, Model Size=1.7B, Training Algorithm=LambdaPO, Temperature (tau)=2.02026.05 | 41.89 | 52.04 | |
| Qwen3-1.7B-base-grpoModel Architecture=Qwen3, Model Size=1.7B, Training Algorithm=GRPO2026.05 | 41.78 | 51.42 | |
| Qwen3-1.7B-temp0.5Model Architecture=Qwen3, Model Size=1.7B, Training Algorithm=LambdaPO, Temperature (tau)=0.52026.05 | 41.41 | 51.87 | |
| Qwen3-1.7BModel Architecture=Qwen3, Model Size=1.7B2026.05 | 40.78 | 50.86 | |
| Qwen3-1.7B-temp0.1Model Architecture=Qwen3, Model Size=1.7B, Training Algorithm=LambdaPO, Temperature (tau)=0.12026.05 | 40.4 | 51.38 |