Mathematical Reasoning on Minerva (pass@1)
68.1Pass@1RePO
Evaluation Results
| Method | Links | |
|---|---|---|
| RePOtraining_data=SuperGPQA subset (11k)2026.02 | 68.1 | |
| LUFFYtraining_data=SuperGPQA subset (11k)2026.02 | 66.5 | |
| GRPOtraining_data=SuperGPQA subset (11k)2026.02 | 65.4 | |
| PrismBase model=Qwen3-4B-Base2026.03 | 56.62 | |
| R-FewBase model=Qwen3-4B-Base, Selection percentage=5%2026.03 | 53.2 | |
| R-ZeroBase model=Qwen3-4B-Base2026.03 | 52.94 | |
| R-FewBase model=Qwen3-4B-Base, Selection percentage=1%2026.03 | 52.1 | |
| SPICEBase model=Qwen3-4B-Base2026.03 | 51.9 | |
| Qwen3-8Btraining_data=SuperGPQA subset (11k)2026.02 | 51.1 | |
| LENS_GRPOBase Model=Qwen3-8B-Base, RL Method=LENS, Rollout Configuration=Standard2026.01 | 48.16 | |
| GRPOBase Model=Qwen3-8B-Base, RL Method=GRPO, Rollout Configuration=Standard2026.01 | 45.22 | |
| DAPO_extendedBase Model=Qwen3-8B-Base, RL Method=DAPO, Rollout Configuration=2x Rollouts2026.01 | 44.49 | |
| SFPOModel=DS-distilled-Qwen-7B2025.10 | 44.49 | |
| DAPOBase Model=Qwen3-8B-Base, RL Method=DAPO, Rollout Configuration=Standard2026.01 | 44.12 | |
| GRPOModel=DS-distilled-Qwen-7B2025.10 | 43.65 | |
| GRPO_extendedBase Model=Qwen3-8B-Base, RL Method=GRPO, Rollout Configuration=2x Rollouts2026.01 | 43.38 | |
| GRESO_extendedBase Model=Qwen3-8B-Base, RL Method=GRESO, Rollout Configuration=2x Rollouts2026.01 | 43.38 | |
| Qwen3-4B-Base2026.03 | 42.3 | |
| BaseModel=DS-distilled-Qwen-7B2025.10 | 41.73 | |
| LENS_GRPOBase Model=Qwen3-4B-Base, RL Method=LENS, Rollout Configuration=Standard2026.01 | 41.54 | |
| GRESOBase Model=Qwen3-8B-Base, RL Method=GRESO, Rollout Configuration=Standard2026.01 | 41.18 | |
| SFPOModel=Qwen3-4B-Base2025.10 | 40.81 | |
| GRPO_extendedBase Model=Qwen3-4B-Base, RL Method=GRPO, Rollout Configuration=2x Rollouts2026.01 | 39.34 | |
| DAPO_extendedBase Model=Qwen3-4B-Base, RL Method=DAPO, Rollout Configuration=2x Rollouts2026.01 | 39.34 | |
| Fully SupervisedTraining Paradigm=Supervised, Labeled Samples Count=4K, Backbone Model=Qwen2.5-Math-7B, Sampling Temperature (T=0.6)=0.62025.12 | 39.3 | |
| TRAPOTraining Paradigm=Semi-supervised, Labeled Samples Count=4K, Unlabeled Samples Count=12K, Backbone Model=Qwen2.5-Math-7B, Sampling Temperature (T=0.6)=0.62025.12 | 39.3 | |
| Fully SupervisedTraining Paradigm=Supervised, Labeled Samples Count=45K, Backbone Model=Qwen2.5-Math-7B, Sampling Temperature (T=0.6)=0.62025.12 | 39.3 | |
| GRPOModel=Qwen3-4B-Base2025.10 | 38.78 | |
| TRAPOTraining Paradigm=Semi-supervised, Labeled Samples Count=1K, Unlabeled Samples Count=3K, Backbone Model=Qwen2.5-Math-7B, Sampling Temperature (T=0.6)=0.62025.12 | 38.2 | |
| Absolute ZeroBase model=Qwen3-4B-Base2026.03 | 38.2 | |
| LENSbackbone=Qwen2.5-7B2026.01 | 37.87 | |
| GRESO_extendedBase Model=Qwen3-4B-Base, RL Method=GRESO, Rollout Configuration=2x Rollouts2026.01 | 37.5 | |
| GRESObackbone=Qwen2.5-7B2026.01 | 37.5 | |
| SFPOModel=Qwen2.5-Math-7B2025.10 | 36.94 | |
| Token-level EntropyTraining Paradigm=Unsupervised, Unlabeled Samples Count=45K, Backbone Model=Qwen2.5-Math-7B, Sampling Temperature (T=0.6)=0.62025.12 | 36.8 | |
| GRESOBase Model=Qwen3-4B-Base, RL Method=GRESO, Rollout Configuration=Standard2026.01 | 36.76 | |
| GRPOextendedbackbone=Qwen2.5-7B2026.01 | 36.76 | |
| GRPOModel=Qwen2.5-Math-7B2025.10 | 36.76 | |
| DAPObackbone=Qwen2.5-7B2026.01 | 36.4 | |
| Sentence-level EntropyTraining Paradigm=Semi-supervised, Labeled Samples Count=1K, Unlabeled Samples Count=3K, Backbone Model=Qwen2.5-Math-7B, Sampling Temperature (T=0.6)=0.62025.12 | 36 | |
| Self-certaintyTraining Paradigm=Semi-supervised, Labeled Samples Count=1K, Unlabeled Samples Count=3K, Backbone Model=Qwen2.5-Math-7B, Sampling Temperature (T=0.6)=0.62025.12 | 35.3 | |
| DAPOBase Model=Qwen3-4B-Base, RL Method=DAPO, Rollout Configuration=Standard2026.01 | 35.29 | |
| GRPObackbone=Qwen2.5-7B2026.01 | 35.29 | |
| Self-certaintyTraining Paradigm=Unsupervised, Unlabeled Samples Count=45K, Backbone Model=Qwen2.5-Math-7B, Sampling Temperature (T=0.6)=0.62025.12 | 34.9 | |
| Fully SupervisedTraining Paradigm=Supervised, Labeled Samples Count=1K, Backbone Model=Qwen2.5-Math-7B, Sampling Temperature (T=0.6)=0.62025.12 | 34.9 | |
| Token-level EntropyTraining Paradigm=Semi-supervised, Labeled Samples Count=1K, Unlabeled Samples Count=3K, Backbone Model=Qwen2.5-Math-7B, Sampling Temperature (T=0.6)=0.62025.12 | 34.6 | |
| GRPOBase Model=Qwen3-4B-Base, RL Method=GRPO, Rollout Configuration=Standard2026.01 | 34.56 | |
| Qwen3-8B-BaseBase Model=Qwen3-8B-Base, RL Method=None, Rollout Configuration=None2026.01 | 34.29 | |
| TTRLTraining Paradigm=Unsupervised, Unlabeled Samples Count=45K, Backbone Model=Qwen2.5-Math-7B, Sampling Temperature (T=0.6)=0.62025.12 | 33.8 | |
| TTRLTraining Paradigm=Semi-supervised, Labeled Samples Count=1K, Unlabeled Samples Count=3K, Backbone Model=Qwen2.5-Math-7B, Sampling Temperature (T=0.6)=0.62025.12 | 33.1 | |
| SFPOModel=DS-distilled-Qwen-1.5B2025.10 | 32.81 | |
| Qwen-InstructTraining Paradigm=Original, Backbone Model=Qwen2.5-Math-7B, Sampling Temperature (T=0.6)=0.62025.12 | 32.7 | |
| Sentence-level EntropyTraining Paradigm=Unsupervised, Unlabeled Samples Count=45K, Backbone Model=Qwen2.5-Math-7B, Sampling Temperature (T=0.6)=0.62025.12 | 32.7 | |
| DCRLBackbone=Qwen3-8B-Base2026.03 | 32.7 | |
| SFPOModel=Qwen2.5-Math-1.5B2025.10 | 32.07 | |
| GRPOModel=Qwen2.5-Math-1.5B2025.10 | 31.89 | |
| GRPOModel=DS-distilled-Qwen-1.5B2025.10 | 31.71 | |
| DCRLBackbone=Qwen3-4B-Base2026.03 | 31.2 | |
| BaseModel=DS-distilled-Qwen-1.5B2025.10 | 28.86 | |
| GRESObackbone=Qwen2.5-3B2026.01 | 28.31 | |
| LENSbackbone=Qwen2.5-3B2026.01 | 27.94 | |
| Qwen3-4B-BaseBase Model=Qwen3-4B-Base, RL Method=None, Rollout Configuration=None2026.01 | 27.21 | |
| GRPObackbone=Qwen2.5-3B2026.01 | 27.21 | |
| DAPObackbone=Qwen2.5-3B2026.01 | 27.21 | |
| GRPOextendedbackbone=Qwen2.5-3B2026.01 | 27.21 | |
| Qwen2.5-7Bbackbone=Qwen2.5-7B2026.01 | 27.21 | |
| BaseModel=Qwen2.5-Math-7B2025.10 | 27.02 | |
| Qwen2.5-3Bbackbone=Qwen2.5-3B2026.01 | 26.1 | |
| LENS_GRPOBase Model=Llama3.2-3B-Instruct, RL Method=LENS, Rollout Configuration=Standard2026.01 | 22.43 | |
| GRPOBase Model=Llama3.2-3B-Instruct, RL Method=GRPO, Rollout Configuration=Standard2026.01 | 21.69 | |
| DAPOBase Model=Llama3.2-3B-Instruct, RL Method=DAPO, Rollout Configuration=Standard2026.01 | 21.69 | |
| GRESOBase Model=Llama3.2-3B-Instruct, RL Method=GRESO, Rollout Configuration=Standard2026.01 | 21.69 | |
| GRPO_extendedBase Model=Llama3.2-3B-Instruct, RL Method=GRPO, Rollout Configuration=2x Rollouts2026.01 | 20.96 | |
| DAPO_extendedBase Model=Llama3.2-3B-Instruct, RL Method=DAPO, Rollout Configuration=2x Rollouts2026.01 | 20.22 | |
| GRESO_extendedBase Model=Llama3.2-3B-Instruct, RL Method=GRESO, Rollout Configuration=2x Rollouts2026.01 | 18.38 | |
| BaseModel=Qwen2.5-Math-1.5B2025.10 | 17.74 | |
| Llama3.2-3B-InstructBase Model=Llama3.2-3B-Instruct, RL Method=None, Rollout Configuration=None2026.01 | 16.54 | |
| BaseModel=Qwen3-4B-Base2025.10 | 15.99 | |
| DCRLBackbone=Llama3.2-3B-Instruct2026.03 | 15.8 | |
| Qwen-BaseTraining Paradigm=Original, Backbone Model=Qwen2.5-Math-7B, Sampling Temperature (T=0.6)=0.62025.12 | 7.4 |