Mathematical Reasoning on AIME 2024 (Accuracy, Gen. Cost)
65.8AccuracyZIP-RC sampling
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| ZIP-RC samplingModel=Qwen3-1.7B2025.12 | 65.8 | 1.43 | |
| ZIP-RC samplingModel=LFM2-1.2B2025.12 | 60.9 | 1.35 | |
| Weighted BoN Self-evalModel=Qwen3-1.7B2025.12 | 59.4 | 1.4 | |
| ZIP-RC reward pruneModel=LFM2-1.2B2025.12 | 57.5 | 1.49 | |
| Weighted BoN Self-evalModel=LFM2-1.2B2025.12 | 55.1 | 1.6 | |
| Weighted BoN ext. RMModel=Qwen3-1.7B2025.12 | 54.7 | 1.43 | |
| Majority VotingModel=Qwen3-1.7B2025.12 | 53.1 | 1.4 | |
| MV length-pruneModel=LFM2-1.2B2025.12 | 51.3 | 1.7 | |
| Weighted BoN ext. RMModel=LFM2-1.2B2025.12 | 50.3 | 1.53 | |
| Majority VotingModel=LFM2-1.2B2025.12 | 49.6 | 1.6 | |
| ZIP-RC reward pruneModel=Qwen3-1.7B2025.12 | 43.3 | 1.33 | |
| ZIP-RC samplingModel=LFM2-350M2025.12 | 38.8 | 1.49 | |
| Weighted BoN Self-evalModel=LFM2-350M2025.12 | 31.4 | 1.7 | |
| Weighted BoN ext. RMModel=LFM2-350M2025.12 | 28.5 | 1.59 | |
| MV length-pruneModel=LFM2-350M2025.12 | 28.3 | 1.66 | |
| Majority VotingModel=LFM2-350M2025.12 | 26.9 | 1.7 | |
| MV length-pruneModel=Qwen3-1.7B2025.12 | 25.1 | 1.46 | |
| ZIP-RC reward pruneModel=LFM2-350M2025.12 | 21.7 | 1.27 |