Mathematical Reasoning on MATH-500 1 (test)
93.2AccuracyMajority Voting
Evaluation Results
| Method | Links | |
|---|---|---|
| Majority VotingModel=Qwen3-8B, k=322026.05 | 93.2 | |
| Marginal SharpeningModel=Qwen3-8B, K=4, S=82026.05 | 92.8 | |
| Marginal SharpeningModel=Qwen3-8B, K=32, S=12026.05 | 92.4 | |
| Majority VotingModel=Qwen3-1.7B, k=322026.05 | 92 | |
| Marginal SharpeningModel=Qwen3-1.7B, K=32, S=12026.05 | 90.8 | |
| Marginal SharpeningModel=Qwen3-1.7B, K=4, S=82026.05 | 90.4 | |
| TA-OPDSetting=Qwen3-8B (GRPO) -> Qwen3-4B, Supervised-token budget=10%2026.05 | 87.4 | |
| TA-OPD+Ent.Setting=Qwen3-8B (GRPO) -> Qwen3-4B, Supervised-token budget=10%2026.05 | 87 | |
| TIPSetting=Qwen3-8B (GRPO) -> Qwen3-4B, Supervised-token budget=10%2026.05 | 86.2 | |
| EntropySetting=Qwen3-8B (GRPO) -> Qwen3-4B, Supervised-token budget=10%2026.05 | 85.5 | |
| Majority VotingModel=Qwen3-4B, k=322026.05 | 84.8 | |
| Pure OPDSetting=Qwen3-8B (GRPO) -> Qwen3-4B, Supervised-token budget=10%2026.05 | 84.7 | |
| Temperature SamplingModel=Qwen3-8B2026.05 | 84.5 | |
| Marginal SharpeningModel=Qwen3-4B, K=4, S=82026.05 | 84.2 | |
| EntropySetting=Qwen3-14B -> Qwen3-4B, Supervised-token budget=10%2026.05 | 84 | |
| Marginal SharpeningModel=Qwen3-4B, K=32, S=12026.05 | 84 | |
| BaseSetting=Qwen3-8B (GRPO) -> Qwen3-4B, Supervised-token budget=10%2026.05 | 83.6 | |
| BaseSetting=Qwen3-14B -> Qwen3-4B, Supervised-token budget=10%2026.05 | 83.6 | |
| Pure OPDSetting=Qwen3-14B -> Qwen3-4B, Supervised-token budget=10%2026.05 | 83.5 | |
| TA-OPD+Ent.Setting=Qwen3-14B -> Qwen3-4B, Supervised-token budget=10%2026.05 | 83.2 | |
| TA-OPDSetting=Qwen3-14B -> Qwen3-4B, Supervised-token budget=10%2026.05 | 82.5 | |
| TIPSetting=Qwen3-14B -> Qwen3-4B, Supervised-token budget=10%2026.05 | 82.4 | |
| Temperature SamplingModel=Qwen3-1.7B2026.05 | 80.6 | |
| Power SamplingModel=Qwen3-1.7B2026.05 | 76.2 | |
| TIPSetting=Qwen3-4B -> Qwen3-1.7B, Supervised-token budget=10%2026.05 | 75.6 | |
| Pure OPDSetting=Qwen3-4B -> Qwen3-1.7B, Supervised-token budget=10%2026.05 | 75 | |
| TA-OPDSetting=Qwen3-4B -> Qwen3-1.7B, Supervised-token budget=10%2026.05 | 74.7 | |
| TA-OPD+Ent.Setting=Qwen3-4B -> Qwen3-1.7B, Supervised-token budget=10%2026.05 | 74.7 | |
| EntropySetting=Qwen3-4B -> Qwen3-1.7B, Supervised-token budget=10%2026.05 | 74.4 | |
| BaseSetting=Qwen3-4B -> Qwen3-1.7B, Supervised-token budget=10%2026.05 | 72.6 | |
| Temperature SamplingModel=Qwen3-4B2026.05 | 70.9 | |
| Power SamplingModel=Qwen3-4B2026.05 | 69.4 | |
| BaseSetting=DeepSeek-R1-Distill-Qwen-14B -> Qwen2.5-3B, Supervised-token budget=10%2026.05 | 56.31 | |
| TA-OPDSetting=DeepSeek-R1-Distill-Qwen-14B -> Qwen2.5-3B, Supervised-token budget=10%2026.05 | 55.31 | |
| Pure OPDSetting=DeepSeek-R1-Distill-Qwen-14B -> Qwen2.5-3B, Supervised-token budget=10%2026.05 | 52.5 | |
| TA-OPD+Ent.Setting=DeepSeek-R1-Distill-Qwen-14B -> Qwen2.5-3B, Supervised-token budget=10%2026.05 | 52.2 | |
| TIPSetting=DeepSeek-R1-Distill-Qwen-14B -> Qwen2.5-3B, Supervised-token budget=10%2026.05 | 51.4 | |
| EntropySetting=DeepSeek-R1-Distill-Qwen-14B -> Qwen2.5-3B, Supervised-token budget=10%2026.05 | 12.83 |