Mathematical Reasoning on Minerva Math (Accuracy)
93AccuracyOLMo3-7B-Think-DPO + GRPO (FLIP)
Evaluation Results
| Method | Links | |
|---|---|---|
| OLMo3-7B-Think-DPO + GRPO (FLIP)Reward Model=Qwen3-4B FLIP, Training Method=GRPO2026.02 | 93 | |
| OLMo3-7B-Think-DPO + GRPO (FLIP)Reward Model=Qwen3-1.7B FLIP, Training Method=GRPO2026.02 | 92.3 | |
| OLMo3-7B-ThinkStatus=Final version after RLVR2026.02 | 92 | |
| OLMo3-7B-Think-DPO + GRPOReward Model=Qwen3-1.7B LLM-as-a-Judge, Training Method=GRPO2026.02 | 91.8 | |
| OLMo3-7B-Think-DPO + GRPOReward Model=Qwen3-4B LLM-as-a-Judge, Training Method=GRPO2026.02 | 91.8 | |
| OLMo3-7B-Think-DPOBase Model=OLMo3-7B2026.02 | 89.1 | |
| Nemotron-Labs-Diffusion-8BGen. Mode=Linear SS, Avg TPF=4.672026.07 | 67.38 | |
| Nemotron-Labs-Diffusion-8BGen. Mode=Quad. SS, Avg TPF=7.042026.07 | 66.24 | |
| Nemotron-Labs-Diffusion-8BGen. Mode=AR, Avg TPF=1.002026.07 | 66 | |
| Nemotron-Labs-Diffusion-8BGen. Mode=Diff., Avg TPF=2.062026.07 | 65.16 | |
| BACRToken Budget=4096, Average Token Usage=22452026.03 | 60.4 | |
| Critique-GRPOCritique Model=GPT-4o, Decoding budget=16,384 tokens2025.06 | 59.6 | |
| BACRToken Budget=2048, Average Token Usage=22452026.03 | 56.8 | |
| AnytimeReasonerToken Budget=4096, Average Token Usage=25182026.03 | 56 | |
| DAPOToken Budget=4096, Average Token Usage=34892026.03 | 54.2 | |
| R1-GRPOCritique Model=None, Decoding budget=16,384 tokens2025.06 | 54 | |
| Qwen3-32BCritique Model=None, Decoding budget=16,384 tokens2025.06 | 53.7 | |
| SelfBudgeterToken Budget=4096, Average Token Usage=27342026.03 | 53.4 | |
| Qwen3-8BGen. Mode=AR, Avg TPF=1.002026.07 | 52.94 | |
| GRPOToken Budget=4096, Average Token Usage=35672026.03 | 52.8 | |
| AnytimeReasonerToken Budget=2048, Average Token Usage=25182026.03 | 51.4 | |
| ConSteer-RLBackbone=Qwen3-8B-Base2026.06 | 49.3 | |
| SelfBudgeterToken Budget=2048, Average Token Usage=27342026.03 | 48.6 | |
| BACRToken Budget=1024, Average Token Usage=22452026.03 | 46.8 | |
| GRPOBackbone=Qwen3-8B-Base2026.06 | 46.7 | |
| SPIRALFamily=Qwen3-8B-Base Family, Game=Multi-Game2025.06 | 46.3 | |
| DAPOToken Budget=2048, Average Token Usage=34892026.03 | 46 | |
| GRPOModel=Qwen3-4B-Base, QB (Query-preserved mini batching)=false, RB (Reward-balanced batching)=true2026.05 | 46 | |
| ConSteer-RLBackbone=Qwen3-4B-Base2026.06 | 45.2 | |
| GRPOModel=Qwen3-4B-Base, QB (Query-preserved mini batching)=true, RB (Reward-balanced batching)=false2026.05 | 44.9 | |
| Ministral3-8BGen. Mode=AR, Avg TPF=1.002026.07 | 44.58 | |
| GRPOModel=Qwen3-4B-Base, QB (Query-preserved mini batching)=false, RB (Reward-balanced batching)=false2026.05 | 44.5 | |
| GRPOToken Budget=2048, Average Token Usage=35672026.03 | 44.2 | |
| Eurus-2-7B-PRIME-R-TAPtraining=R-TAP integrated2026.03 | 43.8 | |
| GRPOModel=Qwen3-4B-Base, QB (Query-preserved mini batching)=true, RB (Reward-balanced batching)=true2026.05 | 43.4 | |
| SPIRALFamily=Qwen3-4B-Base Family, Game=Multi-Game2025.06 | 42.6 | |
| GRPOBackbone=Qwen3-4B-Base2026.06 | 42.6 | |
| Re-Schedule_sigmoidBackbone=Qwen2.5-Math-7B, Evaluation Protocol=avg@32, Weighting Scheme=sigmoid2025.10 | 42.3 | |
| AnytimeReasonerToken Budget=1024, Average Token Usage=25182026.03 | 42.2 | |
| S1KModel=Qwen3-14B-Base, Decoding Strategy=Zero-shot greedy2026.04 | 40.8 | |
| Qwen3-4B-Base + RLBase Model=Qwen3-4B, Optimization Method=RL, Training Dataset=DeepScaleR2025.11 | 40.1 | |
| ConSteer-RLBackbone=Qwen2.5-Math-7B2026.06 | 40.1 | |
| SelfBudgeterToken Budget=1024, Average Token Usage=27342026.03 | 39.8 | |
| Legislator-Executor (Ours)Model=Qwen3-8B-Base, Decoding Strategy=Zero-shot greedy2026.04 | 39.7 | |
| DAPO + RSPBackbone=Qwen2.5-Math-7B, Step Selection=peak step, Sampling Strategy=greedy2026.05 | 39.7 | |
| Dream-7BGen. Mode=Diff., Avg TPF=1.002026.07 | 39.6 | |
| Eurus-2-7B-PRIME2026.03 | 39.3 | |
| EEPOBase Model=Qwen3-14B-Base2025.10 | 39.3 | |
| LIMOModel=Qwen3-14B-Base, Decoding Strategy=Zero-shot greedy2026.04 | 39 | |
| Legislator-Executor (Ours)Model=Qwen3-14B-Base, Decoding Strategy=Zero-shot greedy2026.04 | 39 | |
| LPPOBackbone=Qwen2.5-Math-7B, Evaluation Protocol=avg@322025.10 | 39 | |
| AbstRaLModel=Qwen2.5-Math-7B-Instruct, GSM Train Method=AbstRaL, Evaluation Protocol=Zero-shot2025.06 | 38.6 | |
| OPOBackbone=Qwen2.5-Math-7B, Evaluation Protocol=avg@322025.10 | 38.6 | |
| ACC_sigmoidBackbone=Qwen2.5-Math-7B, Evaluation Protocol=avg@32, Weighting Scheme=sigmoid2025.10 | 38.6 | |
| DistRL w/ IPVRMBase Model=Qwen3-8B base, Evaluation=AVG@82026.04 | 38.4 | |
| Qwen3-8B-BaseFamily=Qwen3-8B-Base Family2025.06 | 38.2 | |
| Seed-GRPOBackbone=Qwen2.5-Math-7B, Evaluation Protocol=avg@322025.10 | 38.2 | |
| BaselineBackbone=Qwen3-8B-Base2026.06 | 37.9 | |
| BaseModel=Qwen3-14B-Base, Decoding Strategy=Zero-shot greedy2026.04 | 37.5 | |
| S1KModel=Qwen3-8B-Base, Decoding Strategy=Zero-shot greedy2026.04 | 37.5 | |
| GRPOBackbone=Qwen2.5-Math-7B, Evaluation Protocol=avg@322025.10 | 37.5 | |
| Eurus-PRIMEBackbone=Qwen2.5-Math-7B, Evaluation Protocol=avg@322025.10 | 37.5 | |
| DAPOBackbone=Qwen2.5-Math-7B, Step Selection=peak step, Sampling Strategy=greedy2026.05 | 37.5 | |
| DAPOToken Budget=1024, Average Token Usage=34892026.03 | 37.4 | |
| Llama-3.1-70B-Inst.2026.03 | 37.1 | |
| SimpleRL-ZooBackbone=Qwen2.5-Math-7B, Evaluation Protocol=avg@322025.10 | 37.1 | |
| DIVERBase Model=DeepSeek-R1-Distill-Qwen-7B2025.09 | 36.8 | |
| GPT-4o2026.03 | 36.8 | |
| GRPOBase Model=Qwen3-14B-Base2025.10 | 36.8 | |
| GRPOModel=Qwen2.5-Math-7B, QB (Query-preserved mini batching)=true, RB (Reward-balanced batching)=false2026.05 | 36.7 | |
| RLOO2026.03 | 36.4 | |
| GRPO w/ DPO-RMBase Model=Qwen3-8B base, Evaluation=AVG@82026.04 | 36.4 | |
| Re-Schedule_linearBackbone=Qwen2.5-Math-7B, Evaluation Protocol=avg@32, Weighting Scheme=linear2025.10 | 36.4 | |
| GRPOModel=Qwen2.5-Math-7B, QB (Query-preserved mini batching)=true, RB (Reward-balanced batching)=true2026.05 | 36 | |
| SPROBase Model=Qwen3-8B base, Evaluation=AVG@82026.04 | 35.8 | |
| CoT-RLModel=Qwen2.5-Math-7B-Instruct, GSM Train Method=CoT-RL, Evaluation Protocol=Zero-shot2025.06 | 35.7 | |
| GRPOBase Model=DeepSeek-R1-Distill-Qwen-7B, Reward Strategy=Clip-higher2025.09 | 35.7 | |
| LIMOModel=Qwen3-8B-Base, Decoding Strategy=Zero-shot greedy2026.04 | 35.7 | |
| GRPOModel=Qwen3-1.7B-Base, QB (Query-preserved mini batching)=true, RB (Reward-balanced batching)=true2026.05 | 35.7 | |
| GRPOToken Budget=1024, Average Token Usage=35672026.03 | 35.6 | |
| Legislator-Executor (Ours)Model=Qwen3-4B-Base, Decoding Strategy=Zero-shot greedy2026.04 | 35.3 | |
| GRPO w/ IPVRMBase Model=Qwen3-8B base, Evaluation=AVG@82026.04 | 35.2 | |
| GRPOBackbone=Qwen2.5-Math-7B2026.06 | 34.9 | |
| SKPO (Ours)Base Model=Qwen2.5-Math-7B2026.04 | 34.7 | |
| Ori-SFTModel=Qwen2.5-Math-7B-Instruct, GSM Train Method=Ori-SFT, Evaluation Protocol=Zero-shot2025.06 | 34.6 | |
| CoAModel=Qwen2.5-Math-7B-Instruct, GSM Train Method=CoA, Evaluation Protocol=Zero-shot2025.06 | 34.6 | |
| Qwen2.5-Math-7B-Inst.2026.03 | 34.6 | |
| PRIMEBase Model=Qwen3-8B base, Evaluation=AVG@82026.04 | 34.3 | |
| Legislator-Executor (Ours)Model=Qwen2.5-Math-7B, Decoding Strategy=Zero-shot greedy2026.04 | 34.2 | |
| Reinforce w/ Q-RMBase Model=Qwen3-8B base, Evaluation=AVG@82026.04 | 34.2 | |
| SAPOBase Model=Qwen2.5-Math-7B2026.04 | 33.8 | |
| Legislator-Executor (Ours)Model=Qwen2.5-7B-QwQ, Decoding Strategy=Zero-shot greedy2026.04 | 33.8 | |
| GRPOModel=Qwen3-1.7B-Base, QB (Query-preserved mini batching)=true, RB (Reward-balanced batching)=false2026.05 | 33.8 | |
| S1KModel=Qwen3-4B-Base, Decoding Strategy=Zero-shot greedy2026.04 | 33.5 | |
| S1KModel=Qwen2.5-Math-7B, Decoding Strategy=Zero-shot greedy2026.04 | 33.5 | |
| GRPO w/ VRBase Model=Qwen3-8B base, Evaluation=AVG@82026.04 | 33.5 | |
| Eurus-2-7B-SFT2026.03 | 32.7 | |
| BaseModel=Qwen3-8B-Base, Decoding Strategy=Zero-shot greedy2026.04 | 32.7 | |
| BaseModel=Qwen2.5-7B-QwQ, Decoding Strategy=Zero-shot greedy2026.04 | 32.7 | |
| LIMOModel=Qwen2.5-7B-QwQ, Decoding Strategy=Zero-shot greedy2026.04 | 32.7 |