Mathematical Reasoning on AIME 2025 (average@8 score)
35Average@8 ScoreDeepTool
Evaluation Results
| Method | Links | |
|---|---|---|
| DeepToolBackbone=Qwen3-4B, Training Stage=SFT2026.05 | 35 | |
| ReToolBackbone=Qwen2.5-7B, Training Stage=RL-enhanced tool reasoning2026.05 | 30 | |
| ARPO-7BBackbone=Qwen2.5-7B, Training Stage=RL-enhanced tool reasoning2026.05 | 30 | |
| DeepToolBackbone=Qwen3-4B, Training Stage=+RL2026.05 | 30 | |
| DeepToolBackbone=Qwen2.5-7B, Training Stage=+RL2026.05 | 28.6 | |
| ToRLBackbone=Qwen2.5-7B, Training Stage=RL-enhanced tool reasoning2026.05 | 26.7 | |
| DeepToolBackbone=Qwen2.5-7B, Training Stage=SFT2026.05 | 25.8 | |
| ZeroTIR-7BBackbone=Qwen2.5-7B, Training Stage=Zero-RL2026.05 | 25 | |
| DeepToolBackbone=Qwen2.5-7B, Training Stage=w/o thinking2026.05 | 14.2 | |
| DeepToolBackbone=Qwen3-4B, Training Stage=w/o thinking2026.05 | 13.3 | |
| Search-o1Backbone=Qwen2.5-7B, Training Stage=Search-based2026.05 | 10 | |
| Search-R1Backbone=Qwen2.5-7B, Training Stage=Search-based2026.05 | 6.7 | |
| Qwen3-4B-BaseBackbone=Qwen3-4B, Training Stage=Base2026.05 | 6.3 | |
| Qwen2.5-7B-BaseBackbone=Qwen2.5-7B, Training Stage=Base2026.05 | 1.1 | |
| Qwen2.5-7B-TIRBackbone=Qwen2.5-7B, Training Stage=TIR2026.05 | 0.6 |