Mathematical Problem Solving on AMC 2023 (Accuracy avg@k)
97.81Accuracy (avg@k)TRACE (RKL on Ey)
Evaluation Results
| Method | Links | |
|---|---|---|
| TRACE (RKL on Ey)Backbone=Qwen3-8B, Symmetric Think evaluation=true2026.05 | 97.81 | |
| TRACE (FKL on Ky)Backbone=Qwen3-8B, Symmetric Think evaluation=true2026.05 | 97.66 | |
| RLSDBackbone=Qwen3-8B, Symmetric Think evaluation=true2026.05 | 97.03 | |
| GRPOBackbone=Qwen3-8B, Symmetric Think evaluation=true2026.05 | 96.56 | |
| BaseBackbone=Qwen3-8B, Symmetric Think evaluation=true2026.05 | 95.94 | |
| SRPOBackbone=Qwen3-8B, Symmetric Think evaluation=true2026.05 | 93.12 | |
| SDPOBackbone=Qwen3-8B, Symmetric Think evaluation=true2026.05 | 91.41 | |
| TRACE (RKL on Ey)Backbone=Qwen3-1.7B, Symmetric Think evaluation=true2026.05 | 86.82 | |
| BaseBackbone=Qwen3-1.7B, Symmetric Think evaluation=true2026.05 | 86.56 | |
| RLSDBackbone=Qwen3-1.7B, Symmetric Think evaluation=true2026.05 | 84.38 | |
| TRACE (FKL on Ky)Backbone=Qwen3-1.7B, Symmetric Think evaluation=true2026.05 | 83.38 | |
| GRPOBackbone=Qwen3-1.7B, Symmetric Think evaluation=true2026.05 | 81.56 | |
| SRPOBackbone=Qwen3-1.7B, Symmetric Think evaluation=true2026.05 | 62.81 | |
| ACPORegime=N-OnP., Backbone=Qwen2.5-7B, Training Dataset=ORZ-57K, Sampling Strategy=avg@82026.06 | 54.37 | |
| SDPOBackbone=Qwen3-1.7B, Symmetric Think evaluation=true2026.05 | 51.25 | |
| DAPORegime=N-OnP., Backbone=Qwen2.5-7B, Training Dataset=ORZ-57K, Sampling Strategy=avg@82026.06 | 51.2 | |
| ACPORegime=OffP., Backbone=Qwen2.5-7B, Training Dataset=ORZ-57K, Sampling Strategy=avg@82026.06 | 51.2 | |
| High-EntropyRegime=N-OnP., Backbone=Qwen2.5-7B, Training Dataset=ORZ-57K, Sampling Strategy=avg@82026.06 | 50.75 | |
| CISPORegime=N-OnP., Backbone=Qwen2.5-7B, Training Dataset=ORZ-57K, Sampling Strategy=avg@82026.06 | 49.25 | |
| Low-EntropyRegime=N-OnP., Backbone=Qwen2.5-7B, Training Dataset=ORZ-57K, Sampling Strategy=avg@82026.06 | 48.95 | |
| DAPORegime=OffP., Backbone=Qwen2.5-7B, Training Dataset=ORZ-57K, Sampling Strategy=avg@82026.06 | 46.84 | |
| High-EntropyRegime=OffP., Backbone=Qwen2.5-7B, Training Dataset=ORZ-57K, Sampling Strategy=avg@82026.06 | 46.39 | |
| CISPORegime=OffP., Backbone=Qwen2.5-7B, Training Dataset=ORZ-57K, Sampling Strategy=avg@82026.06 | 46.08 | |
| AR-LoptiRegime=N-OnP., Backbone=Qwen2.5-7B, Training Dataset=ORZ-57K, Sampling Strategy=avg@82026.06 | 44.88 | |
| Low-EntropyRegime=OffP., Backbone=Qwen2.5-7B, Training Dataset=ORZ-57K, Sampling Strategy=avg@82026.06 | 40.81 | |
| AR-LoptiRegime=OffP., Backbone=Qwen2.5-7B, Training Dataset=ORZ-57K, Sampling Strategy=avg@82026.06 | 34.94 | |
| Base ModelRegime=N-OnP., Backbone=Qwen2.5-7B, Training Dataset=ORZ-57K, Sampling Strategy=avg@82026.06 | 26.2 |