Mathematical Reasoning on AIME 2025 (avg@K)
68.75Average Score (avg@K)EGRSD
Evaluation Results
| Method | Links | |
|---|---|---|
| EGRSDBackbone=Qwen3-4B, Training Budget=100-step, Thinking Mode=True, K (Samples per prompt)=4, Temperature=1.0, Top-p=0.95, Max Tokens=32,768, Evaluation Runs=12026.05 | 68.75 | |
| OPSDBackbone=Qwen3-4B, Training Budget=100-step, Thinking Mode=True, K (Samples per prompt)=4, Temperature=1.0, Top-p=0.95, Max Tokens=32,768, Evaluation Runs=12026.05 | 67.92 | |
| CL-EGRSDBackbone=Qwen3-4B, Training Budget=100-step, Thinking Mode=True, K (Samples per prompt)=4, Temperature=1.0, Top-p=0.95, Max Tokens=32,768, Evaluation Runs=12026.05 | 67.08 | |
| Baseline (no-train)Backbone=Qwen3-4B, Training Budget=N/A, Thinking Mode=True, K (Samples per prompt)=4, Temperature=1.0, Top-p=0.95, Max Tokens=32,768, Evaluation Runs=12026.05 | 65 | |
| GRPOBackbone=Qwen3-4B, Training Budget=100-step, Thinking Mode=True, K (Samples per prompt)=4, Temperature=1.0, Top-p=0.95, Max Tokens=32,768, Evaluation Runs=12026.05 | 63.33 | |
| CRISPBackbone=Qwen3-4B, Training Budget=100-step, Thinking Mode=True, K (Samples per prompt)=4, Temperature=1.0, Top-p=0.95, Max Tokens=32,768, Evaluation Runs=12026.05 | 63.33 | |
| SFTBackbone=Qwen3-4B, Training Budget=100-step, Thinking Mode=True, K (Samples per prompt)=4, Temperature=1.0, Top-p=0.95, Max Tokens=32,768, Evaluation Runs=12026.05 | 42.5 |