Mathematical Problem Solving on Minerva (accuracy)
31.66AccuracyACPO
Evaluation Results
| Method | Links | |
|---|---|---|
| ACPORegime=OffP., Backbone=Qwen2.5-7B, Training Dataset=ORZ-57K, Sampling Strategy=avg@82026.06 | 31.66 | |
| ACPORegime=N-OnP., Backbone=Qwen2.5-7B, Training Dataset=ORZ-57K, Sampling Strategy=avg@82026.06 | 31.02 | |
| CISPORegime=N-OnP., Backbone=Qwen2.5-7B, Training Dataset=ORZ-57K, Sampling Strategy=avg@82026.06 | 30.51 | |
| DAPORegime=OffP., Backbone=Qwen2.5-7B, Training Dataset=ORZ-57K, Sampling Strategy=avg@82026.06 | 30.47 | |
| DAPORegime=N-OnP., Backbone=Qwen2.5-7B, Training Dataset=ORZ-57K, Sampling Strategy=avg@82026.06 | 29.92 | |
| CISPORegime=OffP., Backbone=Qwen2.5-7B, Training Dataset=ORZ-57K, Sampling Strategy=avg@82026.06 | 29.55 | |
| High-EntropyRegime=OffP., Backbone=Qwen2.5-7B, Training Dataset=ORZ-57K, Sampling Strategy=avg@82026.06 | 29.27 | |
| AR-LoptiRegime=N-OnP., Backbone=Qwen2.5-7B, Training Dataset=ORZ-57K, Sampling Strategy=avg@82026.06 | 29.14 | |
| High-EntropyRegime=N-OnP., Backbone=Qwen2.5-7B, Training Dataset=ORZ-57K, Sampling Strategy=avg@82026.06 | 29.08 | |
| Low-EntropyRegime=N-OnP., Backbone=Qwen2.5-7B, Training Dataset=ORZ-57K, Sampling Strategy=avg@82026.06 | 28.72 | |
| AR-LoptiRegime=OffP., Backbone=Qwen2.5-7B, Training Dataset=ORZ-57K, Sampling Strategy=avg@82026.06 | 25.14 | |
| Low-EntropyRegime=OffP., Backbone=Qwen2.5-7B, Training Dataset=ORZ-57K, Sampling Strategy=avg@82026.06 | 25.05 | |
| Base ModelRegime=N-OnP., Backbone=Qwen2.5-7B, Training Dataset=ORZ-57K, Sampling Strategy=avg@82026.06 | 13.32 |