Scientific and General Reasoning on GPQA Diamond
50.2Pass@1MulFeRL
Evaluation Results
| Method | Links | |
|---|---|---|
| MulFeRLBackbone=Qwen3-4B-Inst, Training Strategy=Multi-turn Feedback-guided Reinforcement Learning2026.01 | 50.2 | |
| Critique-GRPOBackbone=Qwen3-4B-Inst, Training Strategy=Reinforcement Learning-based Finetuning2026.01 | 45.45 | |
| GRPOBackbone=Qwen3-4B-Inst, Training Strategy=Reinforcement Learning-based Finetuning2026.01 | 43.94 | |
| Dr.GRPOBackbone=Qwen3-4B-Inst, Training Strategy=Reinforcement Learning-based Finetuning2026.01 | 42.83 | |
| Critique-GRPOTraining Data Volume=4k, Critique Mode=CoT-Critique2025.06 | 40.4 | |
| MulFeRLBackbone=Qwen2.5-7B-Base, Training Strategy=Multi-turn Feedback-guided Reinforcement Learning2026.01 | 38.99 | |
| RAFTBackbone=Qwen3-4B-Inst, Training Strategy=Supervised Learning-based Finetuning2026.01 | 37.47 | |
| Critique-GRPOBackbone=Qwen2.5-7B-Base, Training Strategy=Reinforcement Learning-based Finetuning2026.01 | 36.97 | |
| CITL-FTBackbone=Qwen3-4B-Inst, Training Strategy=Supervised Learning-based Finetuning2026.01 | 36.87 | |
| SFTBackbone=Qwen3-4B-Inst, Training Strategy=Supervised Learning-based Finetuning2026.01 | 36.26 | |
| Qwen3-4B-InstBackbone=Qwen3-4B-Inst, Training Strategy=Base Model2026.01 | 35.05 | |
| GRPOBackbone=Qwen2.5-7B-Base, Training Strategy=Reinforcement Learning-based Finetuning2026.01 | 33.43 | |
| Dr.GRPOBackbone=Qwen2.5-7B-Base, Training Strategy=Reinforcement Learning-based Finetuning2026.01 | 33.13 | |
| SFTBackbone=Qwen2.5-7B-Base, Training Strategy=Supervised Learning-based Finetuning2026.01 | 28.08 | |
| Qwen2.5-7B-BaseBackbone=Qwen2.5-7B-Base, Training Strategy=Base Model2026.01 | 27.68 | |
| CITL-FTBackbone=Qwen2.5-7B-Base, Training Strategy=Supervised Learning-based Finetuning2026.01 | 27.07 | |
| Qwen2.5-Math-7B-BaseTraining Data Volume=None2025.06 | 26.77 | |
| RAFTBackbone=Qwen2.5-7B-Base, Training Strategy=Supervised Learning-based Finetuning2026.01 | 23.94 | |
| Oat-ZeroTraining Data Volume=46k2025.06 | 23.7 | |
| SimpleRL-ZeroTraining Data Volume=46k2025.06 | 23.2 | |
| PRIME-ZeroTraining Data Volume=46k2025.06 | 18.2 |