Science Reasoning Accuracy on GPQA
54.67Accuracy (GPQA)EAPO
Evaluation Results
| Method | Links | |
|---|---|---|
| EAPOModel=Qwen-3-8B-Base2026.06 | 54.67 | |
| DAPOModel=Qwen-3-8B-Base2026.06 | 52.27 | |
| OPDModel=Qwen-3-8B-Base2026.06 | 52.27 | |
| MOPDModel=Qwen-3-8B-Base2026.06 | 50.51 | |
| GRPOModel=Qwen-3-8B-Base2026.06 | 50.44 | |
| EAPOModel=Qwen-2.5-Math-7B2026.06 | 43.18 | |
| EAPO w/o sISModel=Qwen-2.5-Math-7B2026.06 | 41.98 | |
| Trajectory ReplayModel=Qwen-2.5-Math-7B2026.06 | 39.67 | |
| OPDModel=Qwen-2.5-Math-7B2026.06 | 39.39 | |
| DAPOModel=Qwen-2.5-Math-7B2026.06 | 39.27 | |
| MOPDModel=Qwen-2.5-Math-7B2026.06 | 38.76 | |
| GRPOModel=Qwen-2.5-Math-7B2026.06 | 34.34 | |
| MENTORBackbone=Qwen2.5-7B-Base2025.10 | 30.8 | |
| MENTORBackbone=LLaMa3.1-8B-Base2025.10 | 30.3 | |
| QuestABackbone=Qwen2.5-7B-Base2025.10 | 30.3 | |
| On-policy RLBackbone=Qwen2.5-7B-Base2025.10 | 29.3 | |
| LUFFYBackbone=LLaMa3.1-8B-Base2025.10 | 27.8 | |
| LUFFYBackbone=Qwen2.5-7B-Base2025.10 | 26.8 | |
| On-policy RLBackbone=LLaMa3.1-8B-Base2025.10 | 25.8 | |
| QuestABackbone=LLaMa3.1-8B-Base2025.10 | 25.3 | |
| MENTORBackbone=Qwen2.5-3B-Base2025.10 | 22.7 | |
| On-policy RLBackbone=Qwen2.5-3B-Base2025.10 | 17.7 | |
| QuestABackbone=Qwen2.5-3B-Base2025.10 | 16.2 | |
| LUFFYBackbone=Qwen2.5-3B-Base2025.10 | 15.2 | |
| BaseBackbone=Qwen2.5-7B-Base2025.10 | 11.1 | |
| Reinforce++Model Backbone=Qwen3-8B(Strong Model), Optimization Method=Reinforce++2025.08 | 4.35 | |
| VRPOModel Backbone=Qwen3-8B(Strong Model), Optimization Method=VRPO2025.08 | 4.35 | |
| VRPOOptimization Type=test-time optimization, Reward Type=rule-based rewards2025.08 | 4.17 | |
| Dr.GRPOModel Backbone=Qwen3-8B(Strong Model), Optimization Method=Dr.GRPO2025.08 | 3.99 | |
| VRPOModel Backbone=Qwen2.5-7B-Cold Start(Weak Model), Optimization Method=VRPO2025.08 | 3.44 | |
| BaseModel Backbone=Qwen3-8B(Strong Model), Optimization Method=Base2025.08 | 3.1 | |
| GRPOOptimization Type=test-time optimization, Reward Type=rule-based rewards2025.08 | 3.08 | |
| BaseBackbone=Qwen2.5-3B-Base2025.10 | 3 | |
| GRPOModel Backbone=Qwen3-8B(Strong Model), Optimization Method=GRPO2025.08 | 2.98 | |
| PPOOptimization Type=test-time optimization, Reward Type=rule-based rewards2025.08 | 2.54 | |
| PPOModel Backbone=Qwen2.5-7B-Cold Start(Weak Model), Optimization Method=PPO2025.08 | 2.54 | |
| Cold StartOptimization Type=test-time optimization, Reward Type=rule-based rewards2025.08 | 2.53 | |
| GRPOModel Backbone=Qwen2.5-7B-Cold Start(Weak Model), Optimization Method=GRPO2025.08 | 2.36 | |
| Reinforce++Model Backbone=Qwen2.5-7B-Cold Start(Weak Model), Optimization Method=Reinforce++2025.08 | 2.17 | |
| PPOModel Backbone=Qwen3-8B(Strong Model), Optimization Method=PPO2025.08 | 2.17 | |
| BaseModel Backbone=Qwen2.5-7B-Cold Start(Weak Model), Optimization Method=Base2025.08 | 1.45 | |
| Dr.GRPOModel Backbone=Qwen2.5-7B-Cold Start(Weak Model), Optimization Method=Dr.GRPO2025.08 | 1.27 | |
| BaseBackbone=LLaMa3.1-8B-Base2025.10 | 0 |