Mathematical Reasoning on Olympiad (ACC, LEN)
46.1AccuracyReLIFT
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| ReLIFTBackbone=Qwen2.5-7B2025.06 | 46.1 | 3,649 | |
| SFTBackbone=Qwen2.5-7B2025.06 | 44.3 | 6,234 | |
| RLBackbone=Qwen2.5-7B2025.06 | 42.2 | 1,438 | |
| KAEBackbone=Qwen2.5-Math-7B, Post-training Dataset=MATH (levels 3-5, 5k+), Training Steps=200, Group Size=G = 8, Temperature=0.62026.04 | 39.7 | — | |
| ReLIFTBackbone=Qwen2.5-Math-1.5B2025.06 | 39.6 | 2,274 | |
| GRPOBackbone=Qwen2.5-Math-7B, Post-training Dataset=MATH (levels 3-5, 5k+), Training Steps=200, Group Size=G = 8, Temperature=0.62026.04 | 38.52 | — | |
| Dr. GRPOBackbone=Qwen2.5-Math-7B, Post-training Dataset=MATH (levels 3-5, 5k+), Training Steps=200, Group Size=G = 8, Temperature=0.62026.04 | 37.48 | — | |
| Qwen-7B-InstructBackbone=Qwen2.5-7B2025.06 | 37.3 | 1,550 | |
| RLBackbone=Qwen2.5-Math-1.5B2025.06 | 37.2 | 1,695 | |
| GPGBackbone=Qwen2.5-Math-7B, Post-training Dataset=MATH (levels 3-5, 5k+), Training Steps=200, Group Size=G = 8, Temperature=0.62026.04 | 36.89 | — | |
| Qwen-Math-1.5B-InstructBackbone=Qwen2.5-Math-1.5B2025.06 | 35.7 | 2,834 | |
| SFTBackbone=Qwen2.5-Math-1.5B2025.06 | 33.8 | 7,231 | |
| Qwen-7BBackbone=Qwen2.5-7B2025.06 | 26.5 | 1,068 | |
| Qwen-Math-1.5BBackbone=Qwen2.5-Math-1.5B2025.06 | 18.5 | 1,619 | |
| LLaMa-8B-InstructBackbone=LLaMA-3.1-8B2025.06 | 13.8 | 1,063 | |
| ReLIFTBackbone=LLaMA-3.1-8B2025.06 | 11 | 1,050 | |
| SFTBackbone=LLaMA-3.1-8B2025.06 | 8.6 | 1,997 | |
| RLBackbone=LLaMA-3.1-8B2025.06 | 7.3 | 790 | |
| Qwen3-8B (Ours)Backbone=Qwen3-8B2026.04 | 0.673 | — | |
| Qwen3-4B (Ours)Backbone=Qwen3-4B2026.04 | 0.671 | — | |
| Disagreement-Guided Strategy RoutingBackbone=Qwen3-32B2026.04 | 0.628 | — | |
| JETBackbone=DS-Distill-Llama-8B2025.09 | 0.591 | 5,822 | |
| RL-PLUSBase Model=Qwen2.5-Math-7B, Training Method=RL-PLUS2025.07 | 0.588 | — | |
| RL-PLUSBase Model=Qwen2.5-Math-7B2025.07 | 0.588 | — | |
| DS-Llama-8B (Ours)Backbone=DS-Llama-8B2026.04 | 0.585 | — | |
| SCoPBackbone=Qwen3-32B2026.04 | 0.577 | — | |
| LUFFYBase Model=Qwen2.5-Math-7B2025.07 | 0.572 | — | |
| GTModel=Qwen3-8B-Base2026.05 | 0.557 | — | |
| BoNBackbone=Qwen3-32B2026.04 | 0.556 | — | |
| ReLIFTBase Model=Qwen2.5-Math-7B2025.07 | 0.548 | — | |
| CAREModel=Qwen3-8B-Base2026.05 | 0.5434 | — | |
| MajorityBackbone=Qwen3-32B2026.04 | 0.543 | — | |
| DVBackbone=Qwen3-32B2026.04 | 0.54 | — | |
| BaseBackbone=DS-Distill-Llama-8B2025.09 | 0.524 | 8,193 | |
| DAPOBackbone=DS-Distill-Llama-8B2025.09 | 0.524 | 6,463 | |
| All-Pairs+Backbone=qwen3-4b-base, nll coefficient=1.0, Setting=Online, Checkpoint selection=Highest checkpoint2026.04 | 0.519 | — | |
| MPO+Backbone=qwen3-4b-base, nll coefficient=1.0, Setting=Online, Checkpoint selection=Highest checkpoint2026.04 | 0.519 | — | |
| GTModel=Qwen3-4B-Base2026.05 | 0.5117 | — | |
| All-Pairs+Backbone=qwen3-4b-base, nll coefficient=0.0, Setting=Online, Checkpoint selection=Highest checkpoint2026.04 | 0.51 | — | |
| Softmax+Backbone=qwen3-4b-base, nll coefficient=1.0, Setting=Online, Checkpoint selection=Highest checkpoint2026.04 | 0.508 | — | |
| BaselineBackbone=Qwen3-32B2026.04 | 0.505 | — | |
| SFT+GRPOBase Model=Qwen2.5-Math-7B2025.07 | 0.504 | — | |
| Margin+Backbone=qwen3-4b-base, nll coefficient=0.0, Setting=Online, Checkpoint selection=Highest checkpoint2026.04 | 0.502 | — | |
| MPO+Backbone=qwen3-4b-base, nll coefficient=0.0, Setting=Online, Checkpoint selection=Highest checkpoint2026.04 | 0.502 | — | |
| Qwen2.5-7B-Math + SFT + RL-TCERBase Model=Qwen2.5-7B-Math, Training Strategy=SFT + RL-TCER2026.04 | 0.496 | — | |
| DAPOBase Model=Qwen2.5-Math-7B2025.07 | 0.496 | — | |
| DPOBackbone=DS-Distill-Llama-8B2025.09 | 0.495 | 6,868 | |
| STABLE-OPDBackbone=Qwen2.5-Math-7B, Teacher=OpenThinkerV32026.04 | 0.493 | — | |
| DPOBackbone=qwen3-4b-base, nll coefficient=1.0, Setting=Online, Checkpoint selection=Highest checkpoint2026.04 | 0.49 | — | |
| DPOBackbone=qwen3-4b-base, nll coefficient=0.0, Setting=Online, Checkpoint selection=Highest checkpoint2026.04 | 0.481 | — | |
| OracleModel=Qwen3-8B-Base2026.05 | 0.4806 | — | |
| Margin+Backbone=qwen3-4b-base, nll coefficient=1.0, Setting=Online, Checkpoint selection=Highest checkpoint2026.04 | 0.479 | — | |
| OPDBackbone=Qwen2.5-Math-7B, Teacher=OpenThinkerV32026.04 | 0.475 | — | |
| Softmax+Backbone=qwen3-4b-base, nll coefficient=0.0, Setting=Online, Checkpoint selection=Highest checkpoint2026.04 | 0.474 | — | |
| Re-ScheduleBackbone=Qwen3-4B-Base2025.10 | 0.474 | — | |
| SFTBackbone=DS-Distill-Llama-8B2025.09 | 0.473 | 6,249 | |
| OPENREASONER-ZEROBackbone=Qwen2.5-Math-7B2026.04 | 0.471 | — | |
| OpenReasonerBase Model=Qwen2.5-Math-7B2025.07 | 0.471 | — | |
| GRPOBackbone=Qwen2.5-Math-7B2026.04 | 0.468 | — | |
| Qwen2.5-7B-Math + SFT + RL-EndoRBase Model=Qwen2.5-7B-Math, Training Strategy=SFT + RL-EndoR2026.04 | 0.468 | — | |
| GRPOBase Model=Qwen2.5-Math-7B, Training Method=GRPO2025.07 | 0.468 | — | |
| GRPOBase Model=Qwen2.5-Math-7B2025.07 | 0.468 | — | |
| RFTBackbone=qwen3-4b-base, nll coefficient=0.0, Setting=Online, Checkpoint selection=Highest checkpoint2026.04 | 0.467 | — | |
| EntropyModel=Qwen3-8B-Base2026.05 | 0.4628 | — | |
| TAPOBase Model=Qwen2.5-Math-7B2025.07 | 0.462 | — | |
| CAREModel=Qwen3-4B-Base2026.05 | 0.4612 | — | |
| ProbModel=Qwen3-8B-Base2026.05 | 0.4591 | — | |
| RandomModel=Qwen3-8B-Base2026.05 | 0.4571 | — | |
| TTRLModel=Qwen3-8B-Base2026.05 | 0.4547 | — | |
| RL-PLUSBase Model=Qwen2.5-Math-1.5B, Training Method=RL-PLUS2025.07 | 0.452 | — | |
| OracleModel=Qwen3-4B-Base2026.05 | 0.4495 | — | |
| SFTBackbone=Qwen2.5-Math-7B2026.04 | 0.437 | — | |
| Qwen2.5-7B-Math + SFTBase Model=Qwen2.5-7B-Math, Training Strategy=SFT2026.04 | 0.437 | — | |
| SFTBase Model=Qwen2.5-Math-7B, Training Method=SFT2025.07 | 0.437 | — | |
| SFTBase Model=Qwen2.5-Math-7B2025.07 | 0.437 | — | |
| OAT-ZEROBackbone=Qwen2.5-Math-7B2026.04 | 0.434 | — | |
| OatBase Model=Qwen2.5-Math-7B2025.07 | 0.434 | — | |
| GRPOBackbone=Qwen3-4B-Base2025.10 | 0.434 | — | |
| Re-Schedule_sigmoidBackbone=Qwen2.5-7B, Weight Function=sigmoid2025.10 | 0.433 | — | |
| RandomModel=Qwen3-4B-Base2026.05 | 0.4254 | — | |
| ProbModel=Qwen3-4B-Base2026.05 | 0.4229 | — | |
| Re-Schedule_linearBackbone=Qwen2.5-7B, Weight Function=linear2025.10 | 0.421 | — | |
| TTRLModel=Qwen3-4B-Base2026.05 | 0.4201 | — | |
| ACCBackbone=Qwen3-4B-Base2025.10 | 0.42 | — | |
| EntropyModel=Qwen3-4B-Base2026.05 | 0.412 | — | |
| QWEN2.5-MATH-7B-INSTRUCTBackbone=Qwen2.5-Math-7B2026.04 | 0.41 | — | |
| Qwen2.5-Math-7B-InstructBase Model=Qwen2.5-Math-7B2025.07 | 0.41 | — | |
| GRPOBackbone=Qwen2.5-7B, Category=Classical RLVR Methods2025.10 | 0.404 | — | |
| PRIME-ZEROBackbone=Qwen2.5-Math-7B2026.04 | 0.403 | — | |
| PRIMEBase Model=Qwen2.5-Math-7B2025.07 | 0.403 | — | |
| SimpleRL-ZooBackbone=Qwen2.5-7B, Category=Classical RLVR Methods2025.10 | 0.403 | — | |
| OPOBackbone=Qwen2.5-7B, Category=Classical RLVR Methods2025.10 | 0.403 | — | |
| GRPO w/ SFT LossBase Model=Qwen2.5-Math-7B2025.07 | 0.394 | — | |
| ACC_sigmoidBackbone=Qwen2.5-7B, Category=Scheduling Methods2025.10 | 0.394 | — | |
| LPPOBackbone=Qwen2.5-7B, Category=Scheduling Methods2025.10 | 0.367 | — | |
| STEERBackbone=Qwen2.5-Math-1.5B, Sampling Strategy=avg@12025.10 | 0.366 | — | |
| Seed-GRPOBackbone=Qwen2.5-7B, Category=Scheduling Methods2025.10 | 0.363 | — | |
| OPOBackbone=Qwen2.5-Math-1.5B, Sampling Strategy=avg@12025.10 | 0.359 | — | |
| Llama3.1-8B-Instruct + SFT + RL-TCERBase Model=Llama3.1-8B-Instruct, Training Strategy=SFT + RL-TCER2026.04 | 0.353 | — | |
| Entro. Adv.Backbone=Qwen2.5-Math-1.5B, Sampling Strategy=avg@12025.10 | 0.349 | — |