Math Reasoning on AIME 24 (Average@16)
17.1Average@16LUFFY
Evaluation Results
| Method | Links | |
|---|---|---|
| LUFFYBackbone=Qwen2.5-7B-Instruct2026.04 | 17.1 | |
| HiLLBackbone=Qwen2.5-7B-Instruct2026.04 | 16.9 | |
| SAGEBackbone=Qwen2.5-7B-Instruct2026.04 | 16 | |
| GRPOextendedbackbone=Qwen2.5-7B2026.01 | 15.62 | |
| HiLLw/o TWBackbone=Qwen2.5-7B-Instruct2026.04 | 15.2 | |
| GRPOBackbone=Qwen2.5-7B-Instruct2026.04 | 15 | |
| Scaf-GRPOBackbone=Qwen2.5-7B-Instruct2026.04 | 14.6 | |
| LENSbackbone=Qwen2.5-7B2026.01 | 14.58 | |
| GRESObackbone=Qwen2.5-7B2026.01 | 14.17 | |
| BaseBackbone=Qwen2.5-7B-Instruct2026.04 | 13.8 | |
| GRPObackbone=Qwen2.5-7B2026.01 | 11.46 | |
| DAPObackbone=Qwen2.5-7B2026.01 | 11.04 | |
| SAGEBackbone=Llama-3.2-3B-Instruct2026.04 | 9.2 | |
| HiLLBackbone=Llama-3.2-3B-Instruct2026.04 | 8.5 | |
| Scaf-GRPOBackbone=Llama-3.2-3B-Instruct2026.04 | 7.7 | |
| LENSbackbone=Qwen2.5-3B2026.01 | 7.08 | |
| HiLLw/o TWBackbone=Llama-3.2-3B-Instruct2026.04 | 6.9 | |
| GRPOBackbone=Llama-3.2-3B-Instruct2026.04 | 6.7 | |
| BaseBackbone=Llama-3.2-3B-Instruct2026.04 | 6.5 | |
| GRESObackbone=Qwen2.5-3B2026.01 | 6.46 | |
| DAPObackbone=Qwen2.5-3B2026.01 | 4.58 | |
| GRPObackbone=Qwen2.5-3B2026.01 | 4.48 | |
| LUFFYBackbone=Llama-3.2-3B-Instruct2026.04 | 4.4 | |
| GRPOextendedbackbone=Qwen2.5-3B2026.01 | 3.96 | |
| Qwen2.5-7Bbackbone=Qwen2.5-7B2026.01 | 3.12 | |
| Qwen2.5-3Bbackbone=Qwen2.5-3B2026.01 | 1.04 |