Mathematical Reasoning on OlympiadBench (average@8 score)
49.8Average@8 ScoreDeepTool
Evaluation Results
| Method | Links | |
|---|---|---|
| DeepToolBackbone=Qwen3-4B, Training Stage=+RL2026.05 | 49.8 | |
| DeepToolBackbone=Qwen2.5-7B, Training Stage=+RL2026.05 | 48.8 | |
| SimpleRL-Zoo-7BBackbone=Qwen2.5-7B, Training Stage=Zero-RL2026.05 | 40.4 | |
| DeepToolBackbone=Qwen3-4B, Training Stage=SFT2026.05 | 39.2 | |
| DeepToolBackbone=Qwen2.5-7B, Training Stage=SFT2026.05 | 38.5 | |
| Qwen3-4B-BaseBackbone=Qwen3-4B, Training Stage=Base2026.05 | 33.4 | |
| DeepToolBackbone=Qwen3-4B, Training Stage=w/o thinking2026.05 | 31.6 | |
| DeepToolBackbone=Qwen2.5-7B, Training Stage=w/o thinking2026.05 | 27.4 | |
| Qwen2.5-7B-BaseBackbone=Qwen2.5-7B, Training Stage=Base2026.05 | 15.4 | |
| Qwen2.5-7B-TIRBackbone=Qwen2.5-7B, Training Stage=TIR2026.05 | 6.2 |