Math Reasoning on MATH
90.54AccuracyXRPO
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| XRPOModel=Qwen3-1.7B2025.10 | 90.54 | — | |
| GSPOModel=Qwen3-1.7B2025.10 | 90.33 | — | |
| DAPOModel=Qwen3-1.7B2025.10 | 89.33 | — | |
| GRPOModel=Qwen3-4B-Base, QB (Query-preserved mini batching)=true, RB (Reward-balanced batching)=true2026.05 | 88.4 | — | |
| GRPOModel=Qwen3-4B-Base, QB (Query-preserved mini batching)=false, RB (Reward-balanced batching)=true2026.05 | 88 | — | |
| GRPOModel=Qwen3-4B-Base, QB (Query-preserved mini batching)=true, RB (Reward-balanced batching)=false2026.05 | 86.4 | — | |
| GRPOModel=Qwen3-4B-Base, QB (Query-preserved mini batching)=false, RB (Reward-balanced batching)=false2026.05 | 86.2 | — | |
| TPO-SModel=Qwen3-1.7B2025.10 | 84.65 | — | |
| GRPOModel=Qwen2.5-Math-7B, QB (Query-preserved mini batching)=true, RB (Reward-balanced batching)=true2026.05 | 82.2 | — | |
| GRPOModel=Qwen2.5-Math-7B, QB (Query-preserved mini batching)=true, RB (Reward-balanced batching)=false2026.05 | 81.6 | — | |
| MoCANBackbone=Qwen2.5-7B-Instruct2025.12 | 75.5 | — | |
| PeCANBackbone=Qwen2.5-7B-Instruct2025.12 | 75.2 | — | |
| NSPOBackbone=Qwen2.5-7B-Instruct2025.12 | 75.05 | — | |
| Qwen2.5-7B-Instruct2025.12 | 74.8 | — | |
| BFPOBackbone=Qwen2.5-7B-Instruct2025.12 | 74.55 | — | |
| DPO-MixBackbone=Qwen2.5-7B-Instruct2025.12 | 74.4 | — | |
| DPO-SBackbone=Qwen2.5-7B-Instruct2025.12 | 74.27 | — | |
| GRPOModel=Qwen3-1.7B-Base, QB (Query-preserved mini batching)=false, RB (Reward-balanced batching)=true2026.05 | 74.2 | — | |
| DPO-HBackbone=Qwen2.5-7B-Instruct2025.12 | 74.05 | — | |
| GRPOModel=Qwen3-1.7B-Base, QB (Query-preserved mini batching)=true, RB (Reward-balanced batching)=true2026.05 | 74 | — | |
| GWO/n=6+CoTBase=Qwen2.52026.04 | 73.8 | — | |
| OMI2 (Full)Base=Qwen2.52026.04 | 73.2 | — | |
| GRPOModel=Qwen2.5-Math-7B, QB (Query-preserved mini batching)=false, RB (Reward-balanced batching)=true2026.05 | 73 | — | |
| GWO+CoTBase=Qwen2.52026.04 | 72.8 | — | |
| GRPOModel=Qwen2.5-Math-7B, QB (Query-preserved mini batching)=false, RB (Reward-balanced batching)=false2026.05 | 72.6 | — | |
| OMI2Base=Qwen2.52026.04 | 72.3 | — | |
| CODEI/O++Base=Qwen2.52026.04 | 72.1 | — | |
| GWOBase=Qwen2.52026.04 | 72.1 | — | |
| CODEI/OBase=Qwen2.52026.04 | 71.9 | — | |
| PyEduBase=Qwen2.52026.04 | 71.4 | — | |
| WIBase=Qwen2.52026.04 | 71.4 | — | |
| CoT-SC/n=5Base=Qwen2.52026.04 | 71.2 | — | |
| WI (Full)Base=Qwen2.52026.04 | 71.1 | — | |
| GRPOModel=Qwen3-1.7B-Base, QB (Query-preserved mini batching)=true, RB (Reward-balanced batching)=false2026.05 | 71 | — | |
| OC-SFT-1Base=Qwen2.52026.04 | 70.9 | — | |
| GRPOModel=Qwen3-1.7B-Base, QB (Query-preserved mini batching)=false, RB (Reward-balanced batching)=false2026.05 | 69.8 | — | |
| CoTBase=Qwen2.52026.04 | 69.7 | — | |
| DenserBackbone=Qwen3-32B-think2025.12 | 57.6 | — | |
| Process SupervisionBackbone=Qwen3-32B-think2025.12 | 56.9 | — | |
| Reflection-CoTBackbone=Qwen3-32B-think2025.12 | 56.3 | — | |
| Self-VerificationBackbone=Qwen3-32B-think2025.12 | 55.8 | — | |
| DenserBackbone=Qwen3-32B2025.12 | 55.1 | — | |
| Tree-of-ThoughtBackbone=Qwen3-32B-think2025.12 | 55 | — | |
| Process SupervisionBackbone=Qwen3-32B2025.12 | 54.5 | — | |
| Self-ConsistencyBackbone=Qwen3-32B-think2025.12 | 54.3 | — | |
| Reflection-CoTBackbone=Qwen3-32B2025.12 | 53.9 | — | |
| Self-VerificationBackbone=Qwen3-32B2025.12 | 53.4 | — | |
| Tree-of-ThoughtBackbone=Qwen3-32B2025.12 | 52.6 | — | |
| Think-to-ThinkBackbone=Qwen3-32B-think2025.12 | 52.6 | — | |
| Self-ConsistencyBackbone=Qwen3-32B2025.12 | 51.9 | — | |
| Chain-of-ThoughtBackbone=Qwen3-32B-think2025.12 | 50.9 | — | |
| Think-to-ThinkBackbone=Qwen3-32B2025.12 | 50.2 | — | |
| Chain-of-ThoughtBackbone=Qwen3-32B2025.12 | 48.7 | — | |
| DenserBackbone=Qwen3-14B2025.12 | 47.9 | -58.7 | |
| Self-VerificationBackbone=Qwen3-14B2025.12 | 46.8 | 142.8 | |
| Process SupervisionBackbone=Qwen3-14B2025.12 | 46.1 | 156.3 | |
| DenserBackbone=Qwen3-14B-no-think2025.12 | 45.8 | — | |
| DenserBackbone=Qwen3-8B-think2025.12 | 45.7 | — | |
| Reflection-CoTBackbone=Qwen3-14B2025.12 | 45.2 | 127.6 | |
| Process SupervisionBackbone=Qwen3-8B-think2025.12 | 44.9 | — | |
| Tree-of-ThoughtBackbone=Qwen3-14B2025.12 | 44.8 | 345.7 | |
| SafeRLHFBackbone=Qwen2.5-7B-Instruct2025.12 | 44.63 | — | |
| TokenSkip (0.9 ratio)Backbone=Qwen3-14B2025.12 | 44.5 | -53.5 | |
| Process SupervisionBackbone=Qwen3-14B-no-think2025.12 | 44.4 | — | |
| Reflection-CoTBackbone=Qwen3-8B-think2025.12 | 44.3 | — | |
| Self-VerificationBackbone=Qwen3-14B-no-think2025.12 | 44.1 | — | |
| Self-VerificationBackbone=Qwen3-8B-think2025.12 | 43.9 | — | |
| Reflection-CoTBackbone=Qwen3-14B-no-think2025.12 | 43.8 | — | |
| Self-ConsistencyBackbone=Qwen3-14B2025.12 | 43.5 | 289.4 | |
| DenserBackbone=Qwen3-8B2025.12 | 43.2 | — | |
| Tree-of-ThoughtBackbone=Qwen3-8B-think2025.12 | 43 | — | |
| Tree-of-ThoughtBackbone=Qwen3-14B-no-think2025.12 | 42.9 | — | |
| Think-to-ThinkBackbone=Qwen3-14B2025.12 | 42.7 | 187.2 | |
| Process SupervisionBackbone=Qwen3-8B2025.12 | 42.6 | — | |
| Self-ConsistencyBackbone=Qwen3-8B-think2025.12 | 42.4 | — | |
| Self-ConsistencyBackbone=Qwen3-14B-no-think2025.12 | 42.3 | — | |
| Reflection-CoTBackbone=Qwen3-8B2025.12 | 42 | — | |
| Self-VerificationBackbone=Qwen3-8B2025.12 | 41.5 | — | |
| Chain-of-Thought (CoT)Backbone=Qwen3-14B2025.12 | 41.2 | 0 | |
| Tree-of-ThoughtBackbone=Qwen3-8B2025.12 | 41.1 | — | |
| Think-to-ThinkBackbone=Qwen3-8B-think2025.12 | 41.1 | — | |
| Think-to-ThinkBackbone=Qwen3-14B-no-think2025.12 | 41 | — | |
| BeConciseBackbone=Qwen3-14B2025.12 | 40.5 | -54.2 | |
| Self-ConsistencyBackbone=Qwen3-8B2025.12 | 40.5 | — | |
| DenserBackbone=Qwen3-4B-think2025.12 | 40.1 | — | |
| AbbreWordsBackbone=Qwen3-14B2025.12 | 39.7 | -50.8 | |
| Chain-of-ThoughtBackbone=Qwen3-8B-think2025.12 | 39.6 | — | |
| Chain-of-ThoughtBackbone=Qwen3-14B-no-think2025.12 | 39.5 | — | |
| Think-to-ThinkBackbone=Qwen3-8B2025.12 | 39.2 | — | |
| Process SupervisionBackbone=Qwen3-4B-think2025.12 | 39.1 | — | |
| Reflection-CoTBackbone=Qwen3-4B-think2025.12 | 38.5 | — | |
| Self-VerificationBackbone=Qwen3-4B-think2025.12 | 38.2 | — | |
| Tree-of-ThoughtBackbone=Qwen3-4B-think2025.12 | 37.8 | — | |
| Chain-of-ThoughtBackbone=Qwen3-8B2025.12 | 37.8 | — | |
| DenserBackbone=Qwen3-4B2025.12 | 37.2 | — | |
| Self-ConsistencyBackbone=Qwen3-4B-think2025.12 | 37.2 | — | |
| W-DOORBackbone=Qwen2.5-7B-Instruct2025.12 | 37.15 | — | |
| OnlyNumbersBackbone=Qwen3-14B2025.12 | 36.8 | -66.2 | |
| Process SupervisionBackbone=Qwen3-4B2025.12 | 36.7 | — | |
| Think-to-ThinkBackbone=Qwen3-4B-think2025.12 | 36.5 | — |