Mathematical Reasoning on Beyond AIME
22Pass@1e3-1.7B + InT+ RL
Evaluation Results
| Method | Links | |
|---|---|---|
| e3-1.7B + InT+ RLRL Data Size=64, Evaluation Protocol=8 rollouts avg.2026.01 | 22 | |
| e3-1.7B + Distill + RLRL Data Size=1216, Evaluation Protocol=8 rollouts avg.2026.01 | 21.75 | |
| e3-1.7B + RLRL Data Size=1216, Evaluation Protocol=8 rollouts avg.2026.01 | 20.88 | |
| Composition-RLBackbone=Qwen3-14B-Base2026.02 | 19.7 | |
| Composition-RLBackbone=Qwen3-30B-A3B-Base2026.02 | 19.5 | |
| Standard RLVRBackbone=Qwen3-14B-Base2026.02 | 17 | |
| Composition-RLBackbone=Qwen3-4B-Base, Curriculum=Depth 1 + 2 + 32026.02 | 14.6 | |
| Composition-RLBackbone=Qwen3-8B-Base2026.02 | 13.9 | |
| Standard RLVRBackbone=Qwen3-8B-Base2026.02 | 13.7 | |
| Composition-RLBackbone=Qwen3-4B-Base, Curriculum=Depth 1 + 22026.02 | 13.1 | |
| Composition-RLBackbone=Qwen3-4B-Base2026.02 | 12.6 | |
| Standard RLVRBackbone=Qwen3-4B-Base2026.02 | 9 | |
| Standard RLVRBackbone=Qwen3-30B-A3B-Base2026.02 | 7.5 | |
| FIGRModel Category=Large Vision-Language Models2025.12 | 0.54 | |
| Qwen3-235B-A22BModel Category=Large Language Models, Thinking Mode=Thinking2025.12 | 0.52 | |
| GLM-4.5VModel Category=Large Vision-Language Models, Parameters=108B2025.12 | 0.47 | |
| Text-only RLModel Category=Large Vision-Language Models, Training=Reinforcement Learning (GRPO)2025.12 | 0.46 | |
| Qwen3-VL-32B-InstructModel Category=Large Vision-Language Models, Parameters=32B2025.12 | 0.43 | |
| Qwen3-32BModel Category=Large Language Models, Thinking Mode=Thinking2025.12 | 0.4 | |
| Qwen3-VL-8B-InstructModel Category=Large Vision-Language Models, Parameters=8B2025.12 | 0.3 | |
| Qwen3-32BModel Category=Large Language Models, Thinking Mode=Non-Thinking2025.12 | 0.16 |