General Reasoning on Aggregate Easy and Hard Benchmarks
63.7AccuracyADaPTthink
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| ADaPTthinkBackbone=Qwen2.5-7B2026.06 | 63.7 | 1,569 | |
| SFT+GRPOBackbone=Qwen2.5-7B2026.06 | 63.3 | 1,540 | |
| ADaPTBackbone=Qwen2.5-7B2026.06 | 62.7 | 1,031 | |
| ARMBackbone=Qwen2.5-7B2026.06 | 61.7 | 1,131 | |
| TLMREBackbone=Qwen2.5-7B2026.06 | 61 | 1,299 | |
| R-4BBackbone=Qwen2.5-7B2026.06 | 60.9 | 1,044 | |
| ADaPTanswerBackbone=Qwen2.5-7B2026.06 | 57.9 | 423 | |
| SFT+GRPOBackbone=Qwen2.5-3B2026.06 | 53.1 | 1,539 | |
| ADaPTthinkBackbone=Qwen2.5-3B2026.06 | 52.6 | 1,530 | |
| ADaPTBackbone=Qwen2.5-3B2026.06 | 51.9 | 1,013 | |
| TLMREBackbone=Qwen2.5-3B2026.06 | 51.1 | 1,279 | |
| ARMBackbone=Qwen2.5-3B2026.06 | 51 | 1,101 | |
| BaseBackbone=Qwen2.5-7B2026.06 | 50.6 | 582 | |
| R-4BBackbone=Qwen2.5-3B2026.06 | 49.4 | 1,014 | |
| ADaPTanswerBackbone=Qwen2.5-3B2026.06 | 47.4 | 485 | |
| SFTBackbone=Qwen2.5-7B2026.06 | 47.3 | 849 | |
| BaseBackbone=Qwen2.5-3B2026.06 | 33.9 | 582 | |
| SFTBackbone=Qwen2.5-3B2026.06 | 29.6 | 472 |