Mathematical Reasoning on Concatenated Mixed-Difficulty Benchmark
92.2AccuracyZIP-RC sampling
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| ZIP-RC samplingModel=Qwen3-1.7B2025.12 | 92.2 | 1.43 | |
| Weighted BoN Self-evalModel=Qwen3-1.7B2025.12 | 91.6 | 1.4 | |
| Majority VotingModel=Qwen3-1.7B2025.12 | 91 | 1.4 | |
| Weighted BoN ext. RMModel=Qwen3-1.7B2025.12 | 91 | 1.43 | |
| ZIP-RC reward pruneModel=Qwen3-1.7B2025.12 | 88.9 | 1.33 | |
| MV length-pruneModel=Qwen3-1.7B2025.12 | 88 | 1.46 | |
| ZIP-RC samplingModel=LFM2-1.2B2025.12 | 86 | 1.35 | |
| ZIP-RC reward pruneModel=LFM2-1.2B2025.12 | 85.8 | 1.49 | |
| MV length-pruneModel=LFM2-1.2B2025.12 | 84.9 | 1.7 | |
| Weighted BoN Self-evalModel=LFM2-1.2B2025.12 | 84.9 | 1.6 | |
| Majority VotingModel=LFM2-1.2B2025.12 | 83.8 | 1.6 | |
| Weighted BoN ext. RMModel=LFM2-1.2B2025.12 | 82.5 | 1.53 | |
| ZIP-RC samplingModel=LFM2-350M2025.12 | 74.1 | 1.49 | |
| Weighted BoN Self-evalModel=LFM2-350M2025.12 | 71.1 | 1.7 | |
| MV length-pruneModel=LFM2-350M2025.12 | 70.6 | 1.66 | |
| Majority VotingModel=LFM2-350M2025.12 | 68.8 | 1.7 | |
| Weighted BoN ext. RMModel=LFM2-350M2025.12 | 67.8 | 1.59 | |
| ZIP-RC reward pruneModel=LFM2-350M2025.12 | 67.8 | 1.27 |