Mathematical Reasoning on MATH 500 (Accuracy, Gen. Cost)
94.1AccuracyZIP-RC sampling
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| ZIP-RC samplingModel=Qwen3-1.7B2025.12 | 94.1 | 1.43 | |
| Weighted BoN Self-evalModel=Qwen3-1.7B2025.12 | 93.6 | 1.4 | |
| ZIP-RC samplingModel=LFM2-1.2B2025.12 | 93.4 | 1.35 | |
| Majority VotingModel=Qwen3-1.7B2025.12 | 93 | 1.4 | |
| Weighted BoN ext. RMModel=Qwen3-1.7B2025.12 | 92.6 | 1.43 | |
| Weighted BoN Self-evalModel=LFM2-1.2B2025.12 | 92.6 | 1.6 | |
| ZIP-RC reward pruneModel=LFM2-1.2B2025.12 | 92.5 | 1.49 | |
| Majority VotingModel=LFM2-1.2B2025.12 | 91.8 | 1.6 | |
| MV length-pruneModel=LFM2-1.2B2025.12 | 91.6 | 1.7 | |
| Weighted BoN ext. RMModel=LFM2-1.2B2025.12 | 91.1 | 1.53 | |
| ZIP-RC reward pruneModel=Qwen3-1.7B2025.12 | 90.3 | 1.33 | |
| ZIP-RC samplingModel=LFM2-350M2025.12 | 86.1 | 1.49 | |
| MV length-pruneModel=Qwen3-1.7B2025.12 | 84.7 | 1.46 | |
| Weighted BoN Self-evalModel=LFM2-350M2025.12 | 84.4 | 1.7 | |
| MV length-pruneModel=LFM2-350M2025.12 | 83.6 | 1.66 | |
| ZIP-RC reward pruneModel=LFM2-350M2025.12 | 83.2 | 1.27 | |
| Majority VotingModel=LFM2-350M2025.12 | 82.7 | 1.7 | |
| Weighted BoN ext. RMModel=LFM2-350M2025.12 | 81.9 | 1.59 |