Mathematical Reasoning on AIME 25 (Average@16)
20.21Average@16LENS_GRPO
Evaluation Results
| Method | Links | |
|---|---|---|
| LENS_GRPOBase Model=Qwen3-8B-Base2026.01 | 20.21 | |
| GenerateBackbone=Qwen2.5-7B-Instruct2026.02 | 18.1 | |
| Verify-AlterBackbone=Qwen2.5-7B-Instruct2026.02 | 17.7 | |
| LENS_GRPOBase Model=Qwen3-4B-Base2026.01 | 16.46 | |
| Verify-InitBackbone=Qwen2.5-7B-Instruct2026.02 | 12.5 | |
| Mixed-TrainBackbone=Qwen2.5-7B-Instruct2026.02 | 9.8 | |
| GenerateBackbone=Qwen2.5-3B-Instruct2026.02 | 8.1 | |
| Qwen3-4B-BaseBase Model=Qwen3-4B-Base2026.01 | 6.7 | |
| Verify-InitBackbone=Qwen2.5-3B-Instruct2026.02 | 6.5 | |
| Mixed-TrainBackbone=Qwen2.5-3B-Instruct2026.02 | 6.3 | |
| Qwen3-8B-BaseBase Model=Qwen3-8B-Base2026.01 | 5.83 | |
| Verify-AlterBackbone=Qwen2.5-3B-Instruct2026.02 | 5.6 | |
| Verify-AlterBackbone=Qwen2.5-1.5B-Instruct2026.02 | 4.2 | |
| Mixed-TrainBackbone=Qwen2.5-1.5B-Instruct2026.02 | 1.5 | |
| Verify-InitBackbone=Qwen2.5-1.5B-Instruct2026.02 | 1.3 | |
| LENS_GRPOBase Model=Llama3.2-3B-Instruct2026.01 | 0.83 | |
| GenerateBackbone=Qwen2.5-1.5B-Instruct2026.02 | 0.8 | |
| Llama3.2-3B-InstructBase Model=Llama3.2-3B-Instruct2026.01 | 0 |