General Reasoning on AIME24 (Accuracy)
91.3AccuracyGoLongRL (w. GRPO)
Evaluation Results
| Method | Links | |
|---|---|---|
| GoLongRL (w. GRPO)Model=Qwen3-30B-A3B-Thinking-2507, Optimization Method=GRPO2026.05 | 91.3 | |
| Qwen3-30B-A3B-Thinking-2507 BaseModel=Qwen3-30B-A3B-Thinking-2507, Optimization Method=Base2026.05 | 90.5 | |
| QwenLong L1.5-30BModel=QwenLong L1.5-30B2026.05 | 89.8 | |
| GoLongRL (w. TMN-Reweight)Model=Qwen3-4B-Thinking-2507, Optimization Method=TMN-Reweight2026.05 | 84.2 | |
| Qwen3-4B-Thinking-2507 BaseModel=Qwen3-4B-Thinking-2507, Optimization Method=Base2026.05 | 82.6 |