Science Reasoning on GPQA Diamond (Pass@1)
91.9Pass@1Gemini-3.0 Pro
Evaluation Results
| Method | Links | |
|---|---|---|
| Gemini-3.0 Protemperature=12025.12 | 91.9 | |
| GPT-5 Hightemperature=12025.12 | 85.7 | |
| Kimi-K2thinking mode=true2025.12 | 84.5 | |
| Claude-4.5-Sonnettemperature=12025.12 | 83.4 | |
| DeepSeek-V3.2thinking mode=true2025.12 | 82.4 | |
| MiniMax M22025.12 | 77.7 | |
| TRAPOTraining Paradigm=Semi-supervised, Labeled Samples Count=4K, Unlabeled Samples Count=12K, Backbone Model=Qwen2.5-Math-7B, Sampling Temperature (T=0.6)=0.62025.12 | 43.9 | |
| Low-temperatureBackbone Model=DeepSeek-Math-7B, Sampling Strategy=Low-temperature2026.04 | 43 | |
| SMC reward-guided lookaheadBackbone Model=Qwen2.5-Math-7B, Sampling Strategy=SMC reward-guided lookahead2026.04 | 42.4 | |
| SMC reward-guided lookaheadBackbone Model=DeepSeek-Math-7B, Sampling Strategy=SMC reward-guided lookahead2026.04 | 42.4 | |
| Scalable Power SamplingBackbone Model=Qwen2.5-Math-7B, Sampling Strategy=Scalable Power Sampling2026.04 | 40.9 | |
| Fully SupervisedTraining Paradigm=Supervised, Labeled Samples Count=45K, Backbone Model=Qwen2.5-Math-7B, Sampling Temperature (T=0.6)=0.62025.12 | 40.4 | |
| Fully SupervisedTraining Paradigm=Supervised, Labeled Samples Count=4K, Backbone Model=Qwen2.5-Math-7B, Sampling Temperature (T=0.6)=0.62025.12 | 39.9 | |
| GRPO (MATH)Backbone Model=Qwen2.5-Math-7B, Sampling Strategy=GRPO (MATH)2026.04 | 39.9 | |
| MixedFramework=TD-Grokking2026.06 | 39.9 | |
| MCMC Power SamplingBackbone Model=Qwen2.5-Math-7B, Sampling Strategy=MCMC Power Sampling2026.04 | 38.9 | |
| QuestAFramework=GRPO2026.06 | 38.89 | |
| DynamicFramework=TD-Grokking2026.06 | 38.89 | |
| SMC (reward)Backbone Model=DeepSeek-Math-7B, Sampling Strategy=SMC (reward)2026.04 | 38.8 | |
| SMC reward-guided lookaheadBackbone Model=Qwen2.5-7B, Sampling Strategy=SMC reward-guided lookahead2026.04 | 38.4 | |
| SMC (reward)Backbone Model=Qwen2.5-Math-7B, Sampling Strategy=SMC (reward)2026.04 | 38.4 | |
| Scaf-GRPOFramework=GRPO2026.06 | 38.38 | |
| TRAPOTraining Paradigm=Semi-supervised, Labeled Samples Count=1K, Unlabeled Samples Count=3K, Backbone Model=Qwen2.5-Math-7B, Sampling Temperature (T=0.6)=0.62025.12 | 37.9 | |
| AblationFramework=GRPO2026.06 | 36.87 | |
| Fully SupervisedTraining Paradigm=Supervised, Labeled Samples Count=1K, Backbone Model=Qwen2.5-Math-7B, Sampling Temperature (T=0.6)=0.62025.12 | 36.4 | |
| Scalable Power SamplingBackbone Model=DeepSeek-Math-7B, Sampling Strategy=Scalable Power Sampling2026.04 | 36.4 | |
| Base2026.06 | 36.36 | |
| TTRLTraining Paradigm=Unsupervised, Unlabeled Samples Count=45K, Backbone Model=Qwen2.5-Math-7B, Sampling Temperature (T=0.6)=0.62025.12 | 35.4 | |
| TTRLTraining Paradigm=Semi-supervised, Labeled Samples Count=1K, Unlabeled Samples Count=3K, Backbone Model=Qwen2.5-Math-7B, Sampling Temperature (T=0.6)=0.62025.12 | 35.4 | |
| GRPO (MATH)Backbone Model=Qwen2.5-7B, Sampling Strategy=GRPO (MATH)2026.04 | 35.4 | |
| Low-temperatureBackbone Model=Qwen2.5-Math-7B, Sampling Strategy=Low-temperature2026.04 | 35.3 | |
| Scalable Power SamplingBackbone Model=Qwen2.5-7B, Sampling Strategy=Scalable Power Sampling2026.04 | 34.9 | |
| Power-SMCBackbone Model=Qwen2.5-Math-7B, Sampling Strategy=Power-SMC2026.04 | 34.9 | |
| MCMC Power SamplingBackbone Model=DeepSeek-Math-7B, Sampling Strategy=MCMC Power Sampling2026.04 | 34.5 | |
| VanillaFramework=GRPO2026.06 | 34.34 | |
| Sub-onlyFramework=TD-Grokking2026.06 | 34.34 | |
| Best-of-NBackbone Model=Qwen2.5-Math-7B, Sampling Strategy=Best-of-N2026.04 | 34.3 | |
| SFTFramework=GRPO2026.06 | 33.84 | |
| Sentence-level EntropyTraining Paradigm=Semi-supervised, Labeled Samples Count=1K, Unlabeled Samples Count=3K, Backbone Model=Qwen2.5-Math-7B, Sampling Temperature (T=0.6)=0.62025.12 | 33.8 | |
| Best-of-NBackbone Model=DeepSeek-Math-7B, Sampling Strategy=Best-of-N2026.04 | 33.8 | |
| Token-level EntropyTraining Paradigm=Unsupervised, Unlabeled Samples Count=45K, Backbone Model=Qwen2.5-Math-7B, Sampling Temperature (T=0.6)=0.62025.12 | 33.3 | |
| BaseBackbone Model=DeepSeek-Math-7B, Sampling Strategy=Base2026.04 | 33.3 | |
| GRPO (MATH)Backbone Model=DeepSeek-Math-7B, Sampling Strategy=GRPO (MATH)2026.04 | 33.3 | |
| Power-SMCBackbone Model=DeepSeek-Math-7B, Sampling Strategy=Power-SMC2026.04 | 32.6 | |
| Sentence-level EntropyTraining Paradigm=Unsupervised, Unlabeled Samples Count=45K, Backbone Model=Qwen2.5-Math-7B, Sampling Temperature (T=0.6)=0.62025.12 | 32.3 | |
| Token-level EntropyTraining Paradigm=Semi-supervised, Labeled Samples Count=1K, Unlabeled Samples Count=3K, Backbone Model=Qwen2.5-Math-7B, Sampling Temperature (T=0.6)=0.62025.12 | 32.3 | |
| SMC (reward)Backbone Model=Qwen2.5-7B, Sampling Strategy=SMC (reward)2026.04 | 32.3 | |
| MCMC Power SamplingBackbone Model=Qwen2.5-7B, Sampling Strategy=MCMC Power Sampling2026.04 | 31.8 | |
| Power-SMCBackbone Model=Qwen2.5-7B, Sampling Strategy=Power-SMC2026.04 | 31.3 | |
| Self-certaintyTraining Paradigm=Unsupervised, Unlabeled Samples Count=45K, Backbone Model=Qwen2.5-Math-7B, Sampling Temperature (T=0.6)=0.62025.12 | 30.8 | |
| Self-certaintyTraining Paradigm=Semi-supervised, Labeled Samples Count=1K, Unlabeled Samples Count=3K, Backbone Model=Qwen2.5-Math-7B, Sampling Temperature (T=0.6)=0.62025.12 | 30.3 | |
| Low-temperatureBackbone Model=Qwen2.5-7B, Sampling Strategy=Low-temperature2026.04 | 30.3 | |
| Best-of-NBackbone Model=Qwen2.5-7B, Sampling Strategy=Best-of-N2026.04 | 28.2 | |
| BaseBackbone Model=Qwen2.5-7B, Sampling Strategy=Base2026.04 | 27.8 | |
| BaseBackbone Model=Qwen2.5-Math-7B, Sampling Strategy=Base2026.04 | 27.8 | |
| Qwen-InstructTraining Paradigm=Original, Backbone Model=Qwen2.5-Math-7B, Sampling Temperature (T=0.6)=0.62025.12 | 24.7 | |
| Qwen-BaseTraining Paradigm=Original, Backbone Model=Qwen2.5-Math-7B, Sampling Temperature (T=0.6)=0.62025.12 | 11.1 |