Mathematical Reasoning on GAO
75.32Pass@1LENS_GRPO
Evaluation Results
| Method | Links | |
|---|---|---|
| LENS_GRPOBase Model=Qwen3-8B-Base2026.01 | 75.32 | |
| LENS_GRPOBase Model=Qwen3-4B-Base2026.01 | 72.99 | |
| GRPOextendedbackbone=Qwen2.5-7B2026.01 | 69.61 | |
| LENSbackbone=Qwen2.5-7B2026.01 | 69.39 | |
| DAPObackbone=Qwen2.5-7B2026.01 | 67.01 | |
| GRESObackbone=Qwen2.5-7B2026.01 | 66.49 | |
| GRPObackbone=Qwen2.5-7B2026.01 | 65.45 | |
| Qwen3-4B-BaseBase Model=Qwen3-4B-Base2026.01 | 65.19 | |
| Qwen3-8B-BaseBase Model=Qwen3-8B-Base2026.01 | 64.68 | |
| GRESObackbone=Qwen2.5-3B2026.01 | 58.96 | |
| LENSbackbone=Qwen2.5-3B2026.01 | 58.96 | |
| DAPObackbone=Qwen2.5-3B2026.01 | 57.4 | |
| GRPObackbone=Qwen2.5-3B2026.01 | 56.62 | |
| GRPOextendedbackbone=Qwen2.5-3B2026.01 | 56.1 | |
| Qwen2.5-7Bbackbone=Qwen2.5-7B2026.01 | 51.43 | |
| LENS_GRPOBase Model=Llama3.2-3B-Instruct2026.01 | 48.83 | |
| Qwen2.5-3Bbackbone=Qwen2.5-3B2026.01 | 44.16 | |
| Llama3.2-3B-InstructBase Model=Llama3.2-3B-Instruct2026.01 | 35.58 |