Mathematical Reasoning on AIME 2025 (Avg@16 Accuracy, ATC)
27.3Avg@16 AccuracyAdaTIR-7B
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| AdaTIR-7BBackbone=Qwen2.5-7B, Training Strategy=AdaTIR2026.01 | 27.3 | 1.57 | |
| Qwen2.5-7B-Instruct (GRPO)Backbone=Qwen2.5-7B, Training Strategy=GRPO2026.01 | 27.1 | 2.01 | |
| Qwen2.5-3B-Instruct (GRPO)Backbone=Qwen2.5-3B, Training Strategy=GRPO2026.01 | 24.2 | 2.58 | |
| AdaTIR-3BBackbone=Qwen2.5-3B, Training Strategy=AdaTIR2026.01 | 23.8 | 2.01 | |
| Qwen2.5-7B-InstructBackbone=Qwen2.5-7B, Training Strategy=Instruct2026.01 | 10 | — | |
| Qwen2.5-3B-InstructBackbone=Qwen2.5-3B, Training Strategy=Instruct2026.01 | 6.7 | — | |
| Qwen2.5-7B-Instruct-TIRBackbone=Qwen2.5-7B, Training Strategy=TIR2026.01 | 5.4 | 0.36 | |
| Qwen2.5-3B-Instruct-TIRBackbone=Qwen2.5-3B, Training Strategy=TIR2026.01 | 1.3 | 0.71 |