Mathematical Reasoning on Mathematics Benchmarks Average
51.9Pass@1OWPO
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| OWPOBase Model=Qwen-3-8B-Base, Checkpoint Selection=best, Evaluation Protocol=k=32 samples per problem (Average@32)2026.05 | 51.9 | — | |
| OWPOBase Model=Qwen-3-8B-Base, Checkpoint Selection=converged, Evaluation Protocol=k=32 samples per problem (Average@32)2026.05 | 50.74 | — | |
| LPOrevBackbone=Qwen3-8B-Base, Base Trainer=MaxRL2026.05 | 50.6 | 60.3 | |
| LPOfwdBackbone=Qwen3-8B-Base, Base Trainer=MaxRL2026.05 | 50.5 | 63.1 | |
| LPOfwdBackbone=Qwen3-8B-Base, Base Trainer=GRPO2026.05 | 50.3 | 58.3 | |
| LPOfwdBackbone=Qwen3-8B-Base, Base Trainer=DrGRPO2026.05 | 49.5 | 59.4 | |
| DrGRPOBackbone=Qwen3-8B-Base2026.05 | 49.1 | 60.4 | |
| LPOrevBackbone=Qwen3-8B-Base, Base Trainer=GRPO2026.05 | 48.7 | 56.5 | |
| MaxRLBackbone=Qwen3-8B-Base2026.05 | 48.6 | 58.2 | |
| LPOrevBackbone=Qwen3-8B-Base, Base Trainer=DrGRPO2026.05 | 47.7 | 56.9 | |
| GRPOBackbone=Qwen3-8B-Base2026.05 | 47.6 | 54.5 | |
| MOPDBase Model=Qwen-3-8B-Base, Checkpoint Selection=best, Evaluation Protocol=k=32 samples per problem (Average@32)2026.05 | 46.4 | — | |
| DAPOBase Model=Qwen-3-8B-Base, Checkpoint Selection=converged, Evaluation Protocol=k=32 samples per problem (Average@32)2026.05 | 46.37 | — | |
| OPDBase Model=Qwen-3-8B-Base, Checkpoint Selection=best, Evaluation Protocol=k=32 samples per problem (Average@32)2026.05 | 45.73 | — | |
| MOPDBase Model=Qwen-3-8B-Base, Checkpoint Selection=converged, Evaluation Protocol=k=32 samples per problem (Average@32)2026.05 | 45.35 | — | |
| DAPOBase Model=Qwen-3-8B-Base, Checkpoint Selection=best, Evaluation Protocol=k=32 samples per problem (Average@32)2026.05 | 45.31 | — | |
| Sym-DAPOBase Model=Qwen-3-8B-Base, Checkpoint Selection=best, Evaluation Protocol=k=32 samples per problem (Average@32)2026.05 | 44.55 | — | |
| OWPOBase Model=Qwen-2.5-Math-7B-Base, Checkpoint Selection=converged, Evaluation Protocol=k=32 samples per problem (Average@32)2026.05 | 44.12 | — | |
| OPDBase Model=Qwen-3-8B-Base, Checkpoint Selection=converged, Evaluation Protocol=k=32 samples per problem (Average@32)2026.05 | 44.07 | — | |
| OWPOBase Model=Qwen-2.5-Math-7B-Base, Checkpoint Selection=best, Evaluation Protocol=k=32 samples per problem (Average@32)2026.05 | 43.91 | — | |
| DAPOBase Model=Qwen-2.5-Math-7B-Base, Checkpoint Selection=converged, Evaluation Protocol=k=32 samples per problem (Average@32)2026.05 | 42.83 | — | |
| Sym-DAPOBase Model=Qwen-3-8B-Base, Checkpoint Selection=converged, Evaluation Protocol=k=32 samples per problem (Average@32)2026.05 | 42.66 | — | |
| MOPDBase Model=Qwen-2.5-Math-7B-Base, Checkpoint Selection=best, Evaluation Protocol=k=32 samples per problem (Average@32)2026.05 | 41.11 | — | |
| GRPOBase Model=Qwen-3-8B-Base, Checkpoint Selection=best, Evaluation Protocol=k=32 samples per problem (Average@32)2026.05 | 40.98 | — | |
| OPDBase Model=Qwen-2.5-Math-7B-Base, Checkpoint Selection=best, Evaluation Protocol=k=32 samples per problem (Average@32)2026.05 | 40.64 | — | |
| DAPOBase Model=Qwen-2.5-Math-7B-Base, Checkpoint Selection=best, Evaluation Protocol=k=32 samples per problem (Average@32)2026.05 | 40.56 | — | |
| OPDBase Model=Qwen-2.5-Math-7B-Base, Checkpoint Selection=converged, Evaluation Protocol=k=32 samples per problem (Average@32)2026.05 | 40.38 | — | |
| Sym-DAPOBase Model=Qwen-2.5-Math-7B-Base, Checkpoint Selection=converged, Evaluation Protocol=k=32 samples per problem (Average@32)2026.05 | 40.01 | — | |
| Sym-DAPOBase Model=Qwen-2.5-Math-7B-Base, Checkpoint Selection=best, Evaluation Protocol=k=32 samples per problem (Average@32)2026.05 | 39.54 | — | |
| MOPDBase Model=Qwen-2.5-Math-7B-Base, Checkpoint Selection=converged, Evaluation Protocol=k=32 samples per problem (Average@32)2026.05 | 39.03 | — | |
| GRPOBase Model=Qwen-3-8B-Base, Checkpoint Selection=converged, Evaluation Protocol=k=32 samples per problem (Average@32)2026.05 | 38.89 | — | |
| GRPOBase Model=Qwen-2.5-Math-7B-Base, Checkpoint Selection=best, Evaluation Protocol=k=32 samples per problem (Average@32)2026.05 | 37.08 | — | |
| GRPOBase Model=Qwen-2.5-Math-7B-Base, Checkpoint Selection=converged, Evaluation Protocol=k=32 samples per problem (Average@32)2026.05 | 35.75 | — | |
| LPOfwdBackbone=Qwen3-1.7B-Base, Base Trainer=GRPO2026.05 | 35.3 | 46.1 | |
| LPOrevBackbone=Qwen3-1.7B-Base, Base Trainer=GRPO2026.05 | 35 | 42.3 | |
| LPOfwdBackbone=Qwen3-1.7B-Base, Base Trainer=MaxRL2026.05 | 35 | 45.6 | |
| LPOrevBackbone=Qwen3-1.7B-Base, Base Trainer=MaxRL2026.05 | 33.6 | 45 | |
| LPOfwdBackbone=Qwen3-1.7B-Base, Base Trainer=DrGRPO2026.05 | 33.4 | 42.5 | |
| BaseBackbone=Qwen3-8B-Base2026.05 | 33.3 | 50 | |
| LPOrevBackbone=Qwen3-1.7B-Base, Base Trainer=DrGRPO2026.05 | 32.9 | 43.9 | |
| GRPOBackbone=Qwen3-1.7B-Base2026.05 | 32.5 | 42.1 | |
| MaxRLBackbone=Qwen3-1.7B-Base2026.05 | 32.4 | 42.8 | |
| DrGRPOBackbone=Qwen3-1.7B-Base2026.05 | 32.2 | 42.2 | |
| BaseBackbone=Qwen3-1.7B-Base2026.05 | 22 | 40.2 |