Mathematical Reasoning on Olympiad-Bench (Pass@1/Pass@8 Correctness and Length)
46.88Accuracy Pass@1CoT Cold-Start + R-Zero
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| CoT Cold-Start + R-ZeroBackbone=Qwen3-8B-Base, # Train=64342025.11 | 46.88 | — | — | — | |
| Self-Instruct + Solver FeedbackBackbone=Qwen3-8B-Base, # Train=63332025.11 | 46.59 | — | — | — | |
| CoT Cold-Start + Solver FeedbackBackbone=Qwen3-8B-Base, # Train=68012025.11 | 46.59 | — | — | — | |
| Self-InstructBackbone=Qwen3-8B-Base, # Train=59902025.11 | 45.4 | — | — | — | |
| Self-Instruct + R-ZeroBackbone=Qwen3-4B-Base, # Train=64612025.11 | 44.81 | — | — | — | |
| Seed SetBackbone=Qwen3-8B-Base, # Train=40002025.11 | 44.51 | — | — | — | |
| CoT Cold-Start + Solver FeedbackBackbone=Qwen3-4B-Base, # Train=67222025.11 | 44.36 | — | — | — | |
| CoT Cold-Start + RLMTBackbone=Qwen3-8B-Base, # Train=63822025.11 | 44.21 | — | — | — | |
| Self-Instruct + RLMTBackbone=Qwen3-8B-Base, # Train=71282025.11 | 44.15 | — | — | — | |
| Self-Instruct + R-ZeroBackbone=Qwen3-8B-Base, # Train=71422025.11 | 44.07 | — | — | — | |
| Self-Instruct + Solver FeedbackBackbone=Qwen3-4B-Base, # Train=54892025.11 | 43.47 | — | — | — | |
| CoT Cold-StartBackbone=Qwen3-8B-Base, # Train=67232025.11 | 41.39 | — | — | — | |
| CoT Cold-StartBackbone=Qwen3-4B-Base, # Train=66162025.11 | 41.25 | — | — | — | |
| CoT Cold-Start + RLMTBackbone=Qwen3-4B-Base, # Train=67032025.11 | 40.5 | — | — | — | |
| CoT Cold-Start + R-ZeroBackbone=Qwen3-4B-Base, # Train=68652025.11 | 39.91 | — | — | — | |
| Seed SetBackbone=Qwen3-4B-Base, # Train=40002025.11 | 39.76 | — | — | — | |
| Self-Instruct + CoT-Self-InstructBackbone=Qwen3-8B-Base, # Train=63882025.11 | 39.61 | — | — | — | |
| Self-Instruct + RLMTBackbone=Qwen3-4B-Base, # Train=68592025.11 | 39.26 | — | — | — | |
| Self-Instruct + CoT-Self-InstructBackbone=Qwen3-4B-Base, # Train=70512025.11 | 38.58 | — | — | — | |
| Self-InstructBackbone=Qwen3-4B-Base, # Train=53752025.11 | 37.69 | — | — | — | |
| Base ModelBackbone=Qwen3-8B-Base, # Train=-2025.11 | 34.42 | — | — | — | |
| Base ModelBackbone=Qwen3-4B-Base, # Train=-2025.11 | 31.01 | — | — | — | |
| DAPO w LATRModel=Qwen2.5-3B, RL Algorithm=DAPO, Rollout Strategy=LATR2025.10 | 30.4 | 47.8 | 1,105 | 2,354 | |
| GRPO w LATRModel=Qwen2.5-3B, RL Algorithm=GRPO, Rollout Strategy=LATR2025.10 | 29.5 | 48.2 | 954 | 1,728 | |
| DAPO w Stoch.Model=Qwen2.5-3B, RL Algorithm=DAPO, Rollout Strategy=Stochastic Sampling2025.10 | 28.1 | 47 | 1,162 | 2,193 | |
| GRPO w Stoch.Model=Qwen2.5-3B, RL Algorithm=GRPO, Rollout Strategy=Stochastic Sampling2025.10 | 27.2 | 47.4 | 1,058 | 2,014 | |
| Qwen2.5-3BModel=Qwen2.5-3B, Configuration=Base Model2025.10 | 8.5 | 25.8 | 1,088 | 2,413 |