Math Reasoning on AIME25 (Average@16)
1,062Average@16LENS
Evaluation Results
| Method | Links | |
|---|---|---|
| LENSbackbone=Qwen2.5-7B2026.01 | 1,062 | |
| DAPObackbone=Qwen2.5-7B2026.01 | 896 | |
| GRESObackbone=Qwen2.5-7B2026.01 | 667 | |
| GRPObackbone=Qwen2.5-7B2026.01 | 583 | |
| GRPOextendedbackbone=Qwen2.5-7B2026.01 | 562 | |
| LENSbackbone=Qwen2.5-3B2026.01 | 312 | |
| GRESObackbone=Qwen2.5-3B2026.01 | 250 | |
| GRPOextendedbackbone=Qwen2.5-3B2026.01 | 229 | |
| GRPObackbone=Qwen2.5-3B2026.01 | 188 | |
| DAPObackbone=Qwen2.5-3B2026.01 | 104 | |
| Qwen2.5-7Bbackbone=Qwen2.5-7B2026.01 | 42 | |
| Qwen2.5-3Bbackbone=Qwen2.5-3B2026.01 | 21 | |
| HiLLBackbone=Qwen2.5-7B-Instruct2026.04 | 15.3 | |
| HiLLw/o TWBackbone=Qwen2.5-7B-Instruct2026.04 | 14.4 | |
| GRPOBackbone=Qwen2.5-7B-Instruct2026.04 | 13.5 | |
| LUFFYBackbone=Qwen2.5-7B-Instruct2026.04 | 13.5 | |
| Scaf-GRPOBackbone=Qwen2.5-7B-Instruct2026.04 | 12.7 | |
| SAGEBackbone=Qwen2.5-7B-Instruct2026.04 | 12.5 | |
| BaseBackbone=Qwen2.5-7B-Instruct2026.04 | 6.7 | |
| Scaf-GRPOBackbone=Llama-3.2-3B-Instruct2026.04 | 2.3 | |
| HiLLw/o TWBackbone=Llama-3.2-3B-Instruct2026.04 | 2.3 | |
| HiLLBackbone=Llama-3.2-3B-Instruct2026.04 | 1.7 | |
| GRPOBackbone=Llama-3.2-3B-Instruct2026.04 | 0.8 | |
| SAGEBackbone=Llama-3.2-3B-Instruct2026.04 | 0.8 | |
| BaseBackbone=Llama-3.2-3B-Instruct2026.04 | 0.6 | |
| LUFFYBackbone=Llama-3.2-3B-Instruct2026.04 | 0.4 |