Mathematical Reasoning on AMC-23 (Accuracy, Tokens)
78.3AccuracyLAPO-I
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| LAPO-I2026.03 | 78.3 | 3,765 | |
| LAPO-D2026.03 | 77.6 | 3,655 | |
| ThinkPrune-4k2026.03 | 76.3 | 3,839 | |
| ThinkPrune-I2k2026.03 | 74.3 | 2,913 | |
| DeepScaler-1.5B2026.03 | 74.2 | 6,416 | |
| HAPO2026.03 | 70.3 | 4,301 | |
| AutoThink2026.03 | 67.8 | 3,658 | |
| Thinkless2026.03 | 65.7 | 5,276 | |
| STRATAGEMModel=STRATAGEM (Ours)2026.04 | 60 | — | |
| Qwen3-4B-BaseModel=Qwen3-4B-Base2026.04 | 50 | — | |
| SPIRALModel=SPIRAL2026.04 | 45 | — |