Mathematical Reasoning on AIME 24 (Acc, Expl., Fmt)
20AccuracyLACE: + SFT & RL
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| LACE: + SFT & RLModel Scale=Qwen3-4B2026.04 | 20 | 14 | 100 | |
| LACE: + SFT & RLModel Scale=Qwen3-1.7B2026.04 | 16.7 | 31 | 76.7 | |
| Independent Sampling: Standard SFT + RLModel Scale=Qwen3-4B2026.04 | 12.5 | 8 | — | |
| Independent Sampling: + VotingModel Scale=Qwen3-1.7B2026.04 | 10 | 34 | — | |
| Independent Sampling: + VotingModel Scale=Qwen3-4B2026.04 | 10 | 8 | — | |
| Isolated Parallel: + SFTModel Scale=Qwen3-4B2026.04 | 10 | 12 | 33.3 | |
| Isolated Parallel: + SFT & RLModel Scale=Qwen3-4B2026.04 | 10 | 8 | 86.7 | |
| Isolated Parallel: + VotingModel Scale=Qwen3-4B2026.04 | 10 | 8 | 86.7 | |
| Independent Sampling: Standard SFT + RLModel Scale=Qwen3-1.7B2026.04 | 8.3 | 34 | — | |
| LACE: + SFTModel Scale=Qwen3-4B2026.04 | 6.7 | 11 | 53.3 | |
| Isolated Parallel: + SFT & RLModel Scale=Qwen3-1.7B2026.04 | 3.3 | 26 | 43.3 | |
| LACE: + SFTModel Scale=Qwen3-1.7B2026.04 | 3.3 | 8 | 36.7 | |
| Isolated Parallel: + SFTModel Scale=Qwen3-1.7B2026.04 | 0 | 17 | 26.7 | |
| Isolated Parallel: + VotingModel Scale=Qwen3-1.7B2026.04 | 0 | 26 | 43.3 | |
| LACE: Continuous Pre-trainModel Scale=Qwen3-1.7B2026.04 | 0 | 38 | 46.7 | |
| LACE: Continuous Pre-trainModel Scale=Qwen3-4B2026.04 | 0 | 23 | 3.3 |