Mathematical Reasoning on Olympiad (Pass@1 Accuracy, Avg Output Length)
60.5Pass@1 AccuracyLaser
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| LaserBase Model=DeepSeek-R1-Distill-Qwen, Model Scale=7B2026.03 | 60.5 | 3,061.9 | |
| VanillaBackbone=Qwen3-4B2026.03 | 58.2 | 9,243 | |
| TRiMSBackbone=Qwen3-4B2026.03 | 57.9 | 1,081.6 | |
| AutoThinkBase Model=DeepSeek-R1-Distill-Qwen, Model Scale=7B2026.03 | 56.1 | 5,052.4 | |
| JETBase Model=DeepSeek-R1-Distill-Qwen, Model Scale=7B2026.03 | 55.1 | 4,653.3 | |
| VanillaBase Model=DeepSeek-R1-Distill-Qwen, Model Scale=7B2026.03 | 54.8 | 7,393.4 | |
| TRiMSBase Model=DeepSeek-R1-Distill-Qwen, Model Scale=7B2026.03 | 54.4 | 1,104.1 | |
| LC-R1Base Model=DeepSeek-R1-Distill-Qwen, Model Scale=7B2026.03 | 53.9 | 3,239.8 | |
| AdaptThinkBase Model=DeepSeek-R1-Distill-Qwen, Model Scale=7B2026.03 | 53.6 | 5,658.7 | |
| HölderPOTraining Stage=RL Post-Trained Models, Backbone=Qwen3-8B-Base, Training Objective=Linear Des: 2 → -22026.05 | 50.3 | — | |
| GeoMinBackbone=Deepseek-R1-Distill-Qwen-1.5B, Supervision Setting=semi-supervised (10% labeled data), Domain Context=In-Domain2026.06 | 49.6 | — | |
| DAPOTraining Stage=RL Post-Trained Models, Backbone=Qwen3-8B-Base2026.05 | 48.7 | — | |
| GSPOTraining Stage=RL Post-Trained Models, Backbone=Qwen3-8B-Base2026.05 | 45.5 | — | |
| AutoThinkBase Model=DeepSeek-R1-Distill-Qwen, Model Scale=1.5B2026.03 | 44.7 | 5,072.6 | |
| LaserBase Model=DeepSeek-R1-Distill-Qwen, Model Scale=1.5B2026.03 | 44.3 | 5,645.9 | |
| JETBase Model=DeepSeek-R1-Distill-Qwen, Model Scale=1.5B2026.03 | 43.7 | 3,665.8 | |
| AdaptThinkBase Model=DeepSeek-R1-Distill-Qwen, Model Scale=1.5B2026.03 | 43.6 | 3,970.8 | |
| TRiMSBase Model=DeepSeek-R1-Distill-Qwen, Model Scale=1.5B2026.03 | 42.7 | 1,307 | |
| GRPOTraining Stage=RL Post-Trained Models, Backbone=Qwen3-8B-Base2026.05 | 42.4 | — | |
| TraPOBackbone=Deepseek-R1-Distill-Qwen-1.5B, Supervision Setting=semi-supervised (10% labeled data), Domain Context=In-Domain2026.06 | 41.9 | — | |
| VanillaBase Model=DeepSeek-R1-Distill-Qwen, Model Scale=1.5B2026.03 | 41 | 8,994.3 | |
| TTRLBackbone=Deepseek-R1-Distill-Qwen-1.5B, Supervision Setting=semi-supervised (10% labeled data), Domain Context=In-Domain2026.06 | 40.9 | — | |
| GCPOBackbone=Qwen3-4B2026.05 | 40.4 | — | |
| Self-certaintyBackbone=Deepseek-R1-Distill-Qwen-1.5B, Supervision Setting=semi-supervised (10% labeled data), Domain Context=In-Domain2026.06 | 40.3 | — | |
| ADaPTthinkBackbone=Qwen2.5-7B2026.06 | 40.2 | 3,071 | |
| Co-rewardingBackbone=Deepseek-R1-Distill-Qwen-1.5B, Supervision Setting=semi-supervised (10% labeled data), Domain Context=In-Domain2026.06 | 39.5 | — | |
| SFT+GRPOBackbone=Qwen2.5-7B2026.06 | 39.5 | 2,850 | |
| DQOBackbone=Qwen3-4B2026.05 | 39.2 | — | |
| DIVERBackbone=Qwen3-4B2026.05 | 38.5 | — | |
| LC-R1Base Model=DeepSeek-R1-Distill-Qwen, Model Scale=1.5B2026.03 | 37.9 | 3,950.1 | |
| Div-R1Backbone=Qwen3-4B2026.05 | 37.9 | — | |
| GRPOBackbone=Qwen3-4B2026.05 | 37.5 | — | |
| DAPOBackbone=Qwen3-4B2026.05 | 36.7 | — | |
| TLMREBackbone=Qwen2.5-7B2026.06 | 36.5 | 2,782 | |
| GCPOBackbone=Qwen3-1.7B2026.05 | 36.2 | — | |
| ARMBackbone=Qwen2.5-7B2026.06 | 36.2 | 2,362 | |
| ADaPTBackbone=Qwen2.5-7B2026.06 | 35.8 | 1,996 | |
| R-4BBackbone=Qwen2.5-7B2026.06 | 34.9 | 2,017 | |
| Seq-entropyBackbone=Deepseek-R1-Distill-Qwen-1.5B, Supervision Setting=semi-supervised (10% labeled data), Domain Context=In-Domain2026.06 | 34.8 | — | |
| DQOBackbone=Qwen3-1.7B2026.05 | 34.2 | — | |
| Tok-entropyBackbone=Deepseek-R1-Distill-Qwen-1.5B, Supervision Setting=semi-supervised (10% labeled data), Domain Context=In-Domain2026.06 | 33.6 | — | |
| DIVERBackbone=Qwen3-1.7B2026.05 | 33.5 | — | |
| DAPOBackbone=Qwen3-1.7B2026.05 | 32.9 | — | |
| Qwen3-4B(Base)Backbone=Qwen3-4B2026.05 | 32.8 | — | |
| ADaPTanswerBackbone=Qwen2.5-7B2026.06 | 31.7 | 795 | |
| ADaPTthinkBackbone=Qwen2.5-3B2026.06 | 31.7 | 3,289 | |
| SFT+GRPOBackbone=Qwen2.5-3B2026.06 | 31.4 | 2,873 | |
| Div-R1Backbone=Qwen3-1.7B2026.05 | 31.2 | — | |
| Qwen3-8B-BaseTraining Stage=Base Model, Backbone=Qwen3-8B-Base2026.05 | 31.1 | — | |
| GRPOBackbone=Qwen3-1.7B2026.05 | 29.5 | — | |
| ADaPTBackbone=Qwen2.5-3B2026.06 | 29.5 | 2,103 | |
| BaseBackbone=Qwen2.5-7B2026.06 | 28.9 | 892 | |
| ARMBackbone=Qwen2.5-3B2026.06 | 28.9 | 2,341 | |
| TLMREBackbone=Qwen2.5-3B2026.06 | 28.4 | 2,085 | |
| R-4BBackbone=Qwen2.5-3B2026.06 | 25.6 | 1,864 | |
| SFTBackbone=Qwen2.5-7B2026.06 | 24.8 | 1,069 | |
| Qwen3-1.7B(Base)Backbone=Qwen3-1.7B2026.05 | 23.7 | — | |
| ADaPTanswerBackbone=Qwen2.5-3B2026.06 | 22.8 | 1,033 | |
| BaseBackbone=Qwen2.5-3B2026.06 | 18.4 | 794 | |
| SFTBackbone=Qwen2.5-3B2026.06 | 9.8 | 692 |