Massive Multitask Language Understanding on MMLU-Pro (ACC, Length)
49.8AccuracyADaPTthink
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| ADaPTthinkBackbone=Qwen2.5-7B2026.06 | 49.8 | 1,083 | |
| SFT+GRPOBackbone=Qwen2.5-7B2026.06 | 48.9 | 1,007 | |
| ADaPTBackbone=Qwen2.5-7B2026.06 | 48.5 | 680 | |
| TLMREBackbone=Qwen2.5-7B2026.06 | 47.4 | 672 | |
| ARMBackbone=Qwen2.5-7B2026.06 | 47 | 647 | |
| R-4BBackbone=Qwen2.5-7B2026.06 | 46.9 | 771 | |
| ADaPTanswerBackbone=Qwen2.5-7B2026.06 | 44.4 | 317 | |
| BaseBackbone=Qwen2.5-7B2026.06 | 42.9 | 613 | |
| SFTBackbone=Qwen2.5-7B2026.06 | 40.1 | 893 | |
| SFT+GRPOBackbone=Qwen2.5-3B2026.06 | 29.4 | 1,114 | |
| ARMBackbone=Qwen2.5-3B2026.06 | 28.6 | 673 | |
| TLMREBackbone=Qwen2.5-3B2026.06 | 28.4 | 1,004 | |
| ADaPTBackbone=Qwen2.5-3B2026.06 | 28.2 | 583 | |
| ADaPTthinkBackbone=Qwen2.5-3B2026.06 | 27.5 | 1,053 | |
| R-4BBackbone=Qwen2.5-3B2026.06 | 26.3 | 518 | |
| ADaPTanswerBackbone=Qwen2.5-3B2026.06 | 25.2 | 272 | |
| BaseBackbone=Qwen2.5-3B2026.06 | 18.2 | 673 | |
| SFTBackbone=Qwen2.5-3B2026.06 | 12.3 | 552 |