Mathematical Reasoning on Aggregate MATH, Minerva, Olympiad, GAO, AMC23, AIME24, AIME25
53.36Average ScoreLENS_GRPO
Evaluation Results
| Method | Links | |
|---|---|---|
| LENS_GRPOBase Model=Qwen3-8B-Base2026.01 | 53.36 | |
| LENS_GRPOBase Model=Qwen3-4B-Base2026.01 | 49.15 | |
| LENSbackbone=Qwen2.5-7B2026.01 | 43.88 | |
| GRPOextendedbackbone=Qwen2.5-7B2026.01 | 42.28 | |
| DAPObackbone=Qwen2.5-7B2026.01 | 41.96 | |
| GRESObackbone=Qwen2.5-7B2026.01 | 41.69 | |
| GRPObackbone=Qwen2.5-7B2026.01 | 40.79 | |
| Qwen3-8B-BaseBase Model=Qwen3-8B-Base2026.01 | 38.17 | |
| Qwen3-4B-BaseBase Model=Qwen3-4B-Base2026.01 | 34.66 | |
| LENSbackbone=Qwen2.5-3B2026.01 | 33.43 | |
| GRESObackbone=Qwen2.5-3B2026.01 | 32.97 | |
| DAPObackbone=Qwen2.5-3B2026.01 | 31.6 | |
| GRPObackbone=Qwen2.5-3B2026.01 | 30.51 | |
| GRPOextendedbackbone=Qwen2.5-3B2026.01 | 30.05 | |
| Qwen2.5-7Bbackbone=Qwen2.5-7B2026.01 | 27.71 | |
| LENS_GRPOBase Model=Llama3.2-3B-Instruct2026.01 | 27.03 | |
| Qwen2.5-3Bbackbone=Qwen2.5-3B2026.01 | 23.69 | |
| Llama3.2-3B-InstructBase Model=Llama3.2-3B-Instruct2026.01 | 17.06 |