Mathematical Reasoning on AIME 2024 (avg@K)
77.92Avg @K ScoreEGRSD
Evaluation Results
| Method | Links | |
|---|---|---|
| EGRSDBackbone=Qwen3-4B, Training Budget=100-step, Thinking Mode=True, K (Samples per prompt)=4, Temperature=1.0, Top-p=0.95, Max Tokens=32,768, Evaluation Runs=52026.05 | 77.92 | |
| CL-EGRSDBackbone=Qwen3-4B, Training Budget=100-step, Thinking Mode=True, K (Samples per prompt)=4, Temperature=1.0, Top-p=0.95, Max Tokens=32,768, Evaluation Runs=52026.05 | 77.08 | |
| OPSDBackbone=Qwen3-4B, Training Budget=100-step, Thinking Mode=True, K (Samples per prompt)=4, Temperature=1.0, Top-p=0.95, Max Tokens=32,768, Evaluation Runs=52026.05 | 74.48 | |
| CRISPBackbone=Qwen3-4B, Training Budget=100-step, Thinking Mode=True, K (Samples per prompt)=4, Temperature=1.0, Top-p=0.95, Max Tokens=32,768, Evaluation Runs=52026.05 | 74.06 | |
| GRPOBackbone=Qwen3-4B, Training Budget=100-step, Thinking Mode=True, K (Samples per prompt)=4, Temperature=1.0, Top-p=0.95, Max Tokens=32,768, Evaluation Runs=52026.05 | 73.06 | |
| Baseline (no-train)Backbone=Qwen3-4B, Training Budget=N/A, Thinking Mode=True, K (Samples per prompt)=4, Temperature=1.0, Top-p=0.95, Max Tokens=32,768, Evaluation Runs=52026.05 | 73.02 | |
| SFTBackbone=Qwen3-4B, Training Budget=100-step, Thinking Mode=True, K (Samples per prompt)=4, Temperature=1.0, Top-p=0.95, Max Tokens=32,768, Evaluation Runs=52026.05 | 58.61 |