Accuracy on AIME 25
87.9AccuracyQwenLong L1.5-30B
Evaluation Results
| Method | Links | |
|---|---|---|
| QwenLong L1.5-30BModel=QwenLong L1.5-30B2026.05 | 87.9 | |
| GoLongRL (w. GRPO)Model=Qwen3-30B-A3B-Thinking-2507, Optimization Method=GRPO2026.05 | 86.9 | |
| Qwen3-30B-A3B-Thinking-2507 BaseModel=Qwen3-30B-A3B-Thinking-2507, Optimization Method=Base2026.05 | 85.1 | |
| GoLongRL (w. TMN-Reweight)Model=Qwen3-4B-Thinking-2507, Optimization Method=TMN-Reweight2026.05 | 80.8 | |
| Qwen3-4B-Thinking-2507 BaseModel=Qwen3-4B-Thinking-2507, Optimization Method=Base2026.05 | 80.2 | |
| Qwen3-Base SATSize=3×4B2026.04 | 76.7 | |
| OpenAI o3-mini (medium)Size=/2026.04 | 74.8 | |
| Qwen3 (thinking)Size=32B2026.04 | 72.9 | |
| Qwen3-A3BSize=30B2026.04 | 70.9 | |
| QwQSize=32B2026.04 | 69.5 | |
| Llama 3.1-Base SATSize=3×8B2026.04 | 63.4 | |
| Qwen3-Base Debate + JudgeSize=3×8B2026.04 | 61.7 | |
| Qwen3-Base Role-playSize=3×8B2026.04 | 60.5 | |
| Qwen3-Base DebateSize=3×8B2026.04 | 59.1 | |
| DeepSeek-R1 Distill LlamaSize=70B2026.04 | 56.3 | |
| Qwen3-Base-DAPOSize=8B2026.04 | 30.1 | |
| Qwen3-Base-GRPOSize=8B2026.04 | 27.9 | |
| Qwen3-BaseSize=14B2026.04 | 23.3 | |
| Qwen3-BaseSize=32B2026.04 | 20.2 | |
| Qwen2.5-BaseSize=72B2026.04 | 15 | |
| GPT-4o-mini-2024-07-18Size=/2026.04 | 8.8 |