Mathematical Reasoning on AIME 2024 (Mean accuracy)
29.6Mean AccuracyDiSCTT
Evaluation Results
| Method | Links | |
|---|---|---|
| DiSCTTModel=Qwen-2.5-7B-Instruct2026.03 | 29.6 | |
| DiSCTTModel=Qwen-3-1.7B-Base2026.03 | 26.6 | |
| EVOL-RLModel=Qwen-2.5-7B-Instruct2026.03 | 26.3 | |
| DiSCTTModel=Qwen-3-4B-Base2026.03 | 23.7 | |
| EVOL-RLModel=Qwen-3-1.7B-Base2026.03 | 23.3 | |
| EVOL-RLModel=Qwen-3-4B-Base2026.03 | 20.4 | |
| TTRLModel=Qwen-2.5-7B-Instruct2026.03 | 20.3 | |
| TTRLModel=Qwen-3-4B-Base2026.03 | 17.1 | |
| TTRLModel=Qwen-3-1.7B-Base2026.03 | 16.3 | |
| DiSCTTModel=LLaMA-3.2-3B-Instruct2026.03 | 16.3 | |
| BaseModel=Qwen-2.5-7B-Instruct2026.03 | 10.7 | |
| EVOL-RLModel=LLaMA-3.2-3B-Instruct2026.03 | 10 | |
| BaseModel=Qwen-3-4B-Base2026.03 | 10 | |
| TTRLModel=LLaMA-3.2-3B-Instruct2026.03 | 9.6 | |
| BaseModel=Qwen-3-1.7B-Base2026.03 | 6.6 | |
| BaseModel=LLaMA-3.2-3B-Instruct2026.03 | 3.7 | |
| DiSCTTModel=Qwen-2.5-0.5B-Instruct2026.03 | 2.9 | |
| EVOL-RLModel=Qwen-2.5-0.5B-Instruct2026.03 | 2.5 | |
| DiSCTTModel=LLaMA-3.2-1B-Instruct2026.03 | 2.5 | |
| EVOL-RLModel=LLaMA-3.2-1B-Instruct2026.03 | 1.8 | |
| TTRLModel=Qwen-2.5-0.5B-Instruct2026.03 | 1.5 | |
| BaseModel=Qwen-2.5-0.5B-Instruct2026.03 | 1.4 | |
| TTRLModel=LLaMA-3.2-1B-Instruct2026.03 | 1.1 | |
| BaseModel=LLaMA-3.2-1B-Instruct2026.03 | 0.1 |