Mathematical Reasoning on AMC 2023 (Accuracy and Gen. Cost)
93.5AccuracyZIP-RC sampling
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| ZIP-RC samplingModel=LFM2-1.2B2025.12 | 93.5 | 1.35 | |
| Weighted BoN Self-evalModel=LFM2-1.2B2025.12 | 91.8 | 1.6 | |
| ZIP-RC samplingModel=Qwen3-1.7B2025.12 | 90.9 | 1.43 | |
| Majority VotingModel=LFM2-1.2B2025.12 | 90.6 | 1.6 | |
| ZIP-RC reward pruneModel=LFM2-1.2B2025.12 | 90.2 | 1.49 | |
| MV length-pruneModel=LFM2-1.2B2025.12 | 89.8 | 1.7 | |
| Weighted BoN Self-evalModel=Qwen3-1.7B2025.12 | 89.1 | 1.4 | |
| Weighted BoN ext. RMModel=LFM2-1.2B2025.12 | 89 | 1.53 | |
| Majority VotingModel=Qwen3-1.7B2025.12 | 87.9 | 1.4 | |
| Weighted BoN ext. RMModel=Qwen3-1.7B2025.12 | 86.5 | 1.43 | |
| ZIP-RC reward pruneModel=Qwen3-1.7B2025.12 | 86 | 1.33 | |
| ZIP-RC samplingModel=LFM2-350M2025.12 | 83.9 | 1.49 | |
| Weighted BoN Self-evalModel=LFM2-350M2025.12 | 77.6 | 1.7 | |
| MV length-pruneModel=LFM2-350M2025.12 | 74.8 | 1.66 | |
| Majority VotingModel=LFM2-350M2025.12 | 74.5 | 1.7 | |
| Weighted BoN ext. RMModel=LFM2-350M2025.12 | 73.4 | 1.59 | |
| ZIP-RC reward pruneModel=LFM2-350M2025.12 | 69.7 | 1.27 | |
| MV length-pruneModel=Qwen3-1.7B2025.12 | 58.5 | 1.46 |