Mathematical Reasoning on Minerva Math (pass@1 %)
52.9pass@1 AccuracyCritique-GRPO (CoT Critique)
Evaluation Results
| Method | Links | |
|---|---|---|
| Critique-GRPO (CoT Critique)Backbone=Qwen3-8B2025.06 | 52.9 | |
| R1-GRPOw/ External Supervision=true2025.06 | 52.6 | |
| Critique-GRPO (Self-Critique)w/ External Supervision=true2025.06 | 52.6 | |
| Critique-GRPO (Self-Critique & Self-Evaluation)w/ External Supervision=false2025.06 | 52.2 | |
| DeepCompress-Zero-7BParameters=7B, Training=DeepCompress2025.10 | 47.4 | |
| Qwen3-235B-A22BModel Category=Large Language Models, Thinking Mode=Thinking2025.12 | 46.69 | |
| GRPOBase Model=Qwen2.5-Math-7B2025.10 | 46 | |
| GC2POBackbone=DeepSeek-R1-Distill-Qwen-7B2026.02 | 45.6 | |
| DeepMath-Zero-7BParameters=7B, Training=Zero RL2025.10 | 45.4 | |
| Qwen3-32BModel Category=Large Language Models, Thinking Mode=Thinking2025.12 | 45.22 | |
| GCPOBackbone=DeepSeek-R1-Distill-Qwen-7B2026.02 | 45 | |
| L2T-GRPOBackbone=DeepSeek-R1-Distill-Qwen-7B2026.02 | 45 | |
| FIGRModel Category=Large Vision-Language Models2025.12 | 44.49 | |
| MRTBackbone=DeepSeek-R1-Distill-Qwen-7B2026.02 | 44.3 | |
| GVPOBackbone=DeepSeek-R1-Distill-Qwen-7B2026.02 | 44.2 | |
| THRBase Model=Qwen2.5-Math-7B2025.10 | 44.1 | |
| Dr.GRPOBackbone=DeepSeek-R1-Distill-Qwen-7B2026.02 | 44 | |
| SFTw/ External Supervision=true2025.06 | 43.8 | |
| GRPOBackbone=DeepSeek-R1-Distill-Qwen-7B2026.02 | 43.5 | |
| THR (p = 0.1)Base Model=Qwen2.5-Math-7B, p=0.12025.10 | 43.4 | |
| Text-only RLModel Category=Large Vision-Language Models, Training=Reinforcement Learning (GRPO)2025.12 | 43.38 | |
| ReST-MCTSBackbone=DeepSeek-R1-Distill-Qwen-7B2026.02 | 42.8 | |
| DeepSeek-R1-Distill-Qwen-7BFine-tuning=None2026.02 | 42.1 | |
| STEERBackbone=Qwen2.5-Math-7B2025.10 | 41.7 | |
| Qwen3-8B (w/ Think)2025.06 | 41.2 | |
| Qwen3-8BBackbone=Qwen3-8B2025.06 | 41.2 | |
| Qwen-2.5-7B-SRL-ZooParameters=7B, Variant=SRL-Zoo2025.10 | 41.2 | |
| Qwen3-VL-32B-InstructModel Category=Large Vision-Language Models, Parameters=32B2025.12 | 41.18 | |
| Clip–CovBackbone=Qwen2.5-Math-7B2025.10 | 40.8 | |
| Critique-GRPOTraining Data Volume=4k, Critique Mode=CoT-Critique2025.06 | 40.1 | |
| Qwen3-VL-8B-InstructModel Category=Large Vision-Language Models, Parameters=8B2025.12 | 40.07 | |
| length penaltyBackbone=DeepSeek-R1-Distill-Qwen-7B2026.02 | 39.5 | |
| Qwen3-32BModel Category=Large Language Models, Thinking Mode=Non-Thinking2025.12 | 39.34 | |
| PRIME-ZeroTraining Data Volume=46k2025.06 | 39 | |
| GLM-4.5VModel Category=Large Vision-Language Models, Parameters=108B2025.12 | 38.6 | |
| GRPO w/ clip-highBackbone=Qwen2.5-Math-7B2025.10 | 38.6 | |
| Open-Reasoner-Zero-7BParameters=7B, Training=Zero RL2025.10 | 38.4 | |
| OPOBackbone=Qwen2.5-Math-7B2025.10 | 38.2 | |
| GRPO w/ Entro. LossBackbone=Qwen2.5-Math-7B2025.10 | 38.2 | |
| W-REINFORCEBackbone=Qwen2.5-Math-7B2025.10 | 37.8 | |
| Eurus-PRIMEBackbone=Qwen2.5-Math-7B2025.10 | 37.4 | |
| GRPOBackbone=Qwen2.5-Math-7B2025.10 | 37.3 | |
| SimpleRL-ZooBackbone=Qwen2.5-Math-7B2025.10 | 37.1 | |
| GRPO w/ Fork TokensBackbone=Qwen2.5-Math-7B2025.10 | 37.1 | |
| KL–CovBackbone=Qwen2.5-Math-7B2025.10 | 37.1 | |
| Critique-GRPO (CoT Critique)Backbone=Qwen2.5-7B-Base2025.06 | 36.8 | |
| THR (p = -0.1)Base Model=Qwen2.5-Math-7B, p=-0.12025.10 | 36.8 | |
| Entro. Adv.Backbone=Qwen2.5-Math-7B2025.10 | 36.8 | |
| Oat-ZeroTraining Data Volume=46k2025.06 | 34.6 | |
| THR (p = 0.1)Base Model=Qwen2.5-Math-1.5B, p=0.12025.10 | 33.1 | |
| DeepCompress-Zero-3BParameters=3B, Training=DeepCompress2025.10 | 32.7 | |
| THRBase Model=Qwen2.5-Math-1.5B2025.10 | 32.4 | |
| THR (p = -0.1)Base Model=Qwen2.5-Math-1.5B, p=-0.12025.10 | 32 | |
| DeepMath-Zero-3BParameters=3B, Training=Zero RL2025.10 | 30.8 | |
| GRPOBase Model=Qwen2.5-Math-1.5B2025.10 | 29 | |
| Qwen-2.5-3B-InstructParameters=3B, Variant=Instruct2025.10 | 28.9 | |
| GC2POBackbone=DeepScaleR-1.5B-Preview2026.02 | 27.5 | |
| L2T-GRPOBackbone=DeepScaleR-1.5B-Preview2026.02 | 26.5 | |
| GCPOBackbone=DeepScaleR-1.5B-Preview2026.02 | 25.9 | |
| GC2POBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.02 | 25.4 | |
| GVPOBackbone=DeepScaleR-1.5B-Preview2026.02 | 25.3 | |
| Progressive Thought EncodingBackbone Model=Qwen2.5-7B-Instruct, Maximum TFLOPs of Attention=3.6, Peak GPU Mem. (%)=67.2, Mean GPU Mem. (%)=48.62026.02 | 25.3 | |
| Dr.GRPOBackbone=DeepScaleR-1.5B-Preview2026.02 | 25.1 | |
| SimpleRL-ZeroTraining Data Volume=46k2025.06 | 25 | |
| GRPOBackbone=DeepScaleR-1.5B-Preview2026.02 | 24.7 | |
| DeepScaleR-1.5B-PreviewFine-tuning=None2026.02 | 24.6 | |
| L2T-GRPOBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.02 | 24.5 | |
| SFTBackbone=Qwen2.5-7B-Base2025.06 | 24.3 | |
| MRTBackbone=DeepScaleR-1.5B-Preview2026.02 | 24.2 | |
| ReST-MCTSBackbone=DeepScaleR-1.5B-Preview2026.02 | 23.9 | |
| LoRAcBackbone Model=Qwen2.5-7B-Instruct, Maximum TFLOPs of Attention=3.5, Peak GPU Mem. (%)=63.1, Mean GPU Mem. (%)=45.42026.02 | 23.7 | |
| GCPOBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.02 | 23.4 | |
| LoRABackbone Model=Qwen2.5-7B-Instruct, Maximum TFLOPs of Attention=5.7, Peak GPU Mem. (%)=85.8, Mean GPU Mem. (%)=59.32026.02 | 23.4 | |
| GVPOBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.02 | 23.1 | |
| length penaltyBackbone=DeepScaleR-1.5B-Preview2026.02 | 23 | |
| Dr.GRPOBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.02 | 22.9 | |
| MRTBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.02 | 22.5 | |
| GRPOBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.02 | 22.1 | |
| VI-CuRLBackbone=Qwen2.5-Math-1.5B, Reward Supervision=Verifier-Free, Verifier Strategy=Majority Vote2026.02 | 21.6 | |
| Qwen-2.5-3BParameters=3B2025.10 | 20.4 | |
| ReST-MCTSBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.02 | 20.3 | |
| Qwen2.5-7B-BaseBackbone=Qwen2.5-7B-Base2025.06 | 20.2 | |
| DeepSeek-R1-Distill-Qwen-1.5BFine-tuning=None2026.02 | 19.8 | |
| length penaltyBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.02 | 18.8 | |
| BaselineBackbone Model=Qwen2.5-7B-Instruct2026.02 | 18.5 | |
| LoRABackbone Model=DeepSeek-R1-Distill-Llama-8B, Maximum TFLOPs of Attention=7.4, Peak GPU Mem. (%)=88.7, Mean GPU Mem. (%)=53.52026.02 | 18.3 | |
| VI-CuRLBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Reward Supervision=Verifier-Free, Verifier Strategy=Majority Vote2026.02 | 17.8 | |
| Progressive Thought EncodingBackbone Model=DeepSeek-R1-Distill-Llama-8B, Maximum TFLOPs of Attention=4.6, Peak GPU Mem. (%)=59.8, Mean GPU Mem. (%)=46.82026.02 | 16.5 | |
| Progressive Thought EncodingBackbone Model=Qwen2.5-3B-Instruct, Maximum TFLOPs of Attention=2.7, Peak GPU Mem. (%)=45.3, Mean GPU Mem. (%)=32.62026.02 | 16.2 | |
| Qwen-2.5-7BParameters=7B2025.10 | 16.2 | |
| BaselineBackbone Model=Qwen2.5-3B-Instruct2026.02 | 16.1 | |
| LoRAcBackbone Model=Qwen2.5-3B-Instruct, Maximum TFLOPs of Attention=2.6, Peak GPU Mem. (%)=38, Mean GPU Mem. (%)=312026.02 | 16.1 | |
| LoRAcBackbone Model=DeepSeek-R1-Distill-Llama-8B, Maximum TFLOPs of Attention=4.6, Peak GPU Mem. (%)=59.1, Mean GPU Mem. (%)=47.12026.02 | 16 | |
| LoRABackbone Model=Qwen2.5-3B-Instruct, Maximum TFLOPs of Attention=4.2, Peak GPU Mem. (%)=82.8, Mean GPU Mem. (%)=63.52026.02 | 15.9 | |
| BaseBase Model=Qwen2.5-Math-7B2025.10 | 15.8 | |
| BaselineBackbone Model=DeepSeek-R1-Distill-Llama-8B2026.02 | 15.6 | |
| Qwen2.5-Math-7B-BaseTraining Data Volume=None2025.06 | 13.2 | |
| THR (p = 0.2)Base Model=Qwen2.5-0.5B-Ins, p=0.22025.10 | 11 | |
| THR (p = -0.2)Base Model=Qwen2.5-0.5B-Ins, p=-0.22025.10 | 9.9 | |
| Qwen2.5-Math-7BBackbone=Qwen2.5-Math-7B2025.10 | 9.9 |