Arithmetic Reasoning on Countdown (val)
76.27Validation Reward (mean@4)ACPO
Evaluation Results
| Method | Links | |
|---|---|---|
| ACPOBackbone=Qwen2.5-3B-Instruct, Policy Regime=OffP.2026.06 | 76.27 | |
| ACPOBackbone=Qwen2.5-3B-Instruct, Policy Regime=N-OnP.2026.06 | 75.74 | |
| DAPOBackbone=Qwen2.5-3B-Instruct, Policy Regime=OffP.2026.06 | 74.38 | |
| CISPOBackbone=Qwen2.5-3B-Instruct, Policy Regime=N-OnP.2026.06 | 74.25 | |
| Low-EntropyBackbone=Qwen2.5-3B-Instruct, Policy Regime=OffP.2026.06 | 74.04 | |
| High-EntropyBackbone=Qwen2.5-3B-Instruct, Policy Regime=OffP.2026.06 | 73.76 | |
| DAPOBackbone=Qwen2.5-3B-Instruct, Policy Regime=N-OnP.2026.06 | 73.27 | |
| High-EntropyBackbone=Qwen2.5-3B-Instruct, Policy Regime=N-OnP.2026.06 | 70.58 | |
| AR-LoptiBackbone=Qwen2.5-3B-Instruct, Policy Regime=N-OnP.2026.06 | 65.82 | |
| Low-EntropyBackbone=Qwen2.5-3B-Instruct, Policy Regime=N-OnP.2026.06 | 61.81 | |
| AR-LoptiBackbone=Qwen2.5-3B-Instruct, Policy Regime=OffP.2026.06 | 57.41 | |
| CISPOBackbone=Qwen2.5-3B-Instruct, Policy Regime=OffP.2026.06 | 55.12 | |
| Base ModelBackbone=Qwen2.5-3B-Instruct, Policy Regime=N-OnP.2026.06 | 6.9 |