Reasoning on Reasoning Evaluation Suite (MATH, GSM8K, AQUA, GSM-H, MMLU, MMLU-P, AIME) (test)
52.4MATH ScoreSELFORG
Evaluation Results
| Method | Links | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| SELFORGModel=Qwen-2.5-1.5B-Instruct2025.10 | 52.4 | 74.6 | 58.27 | 38 | 53.8 | 31.6 | 6.67 | 45.05 | 1 | |
| DyLANModel=Qwen-2.5-1.5B-Instruct2025.10 | 49.8 | 67.8 | 51.18 | 27.2 | 50 | 15.4 | 3.33 | 37.82 | 4 | |
| SingleModel=Qwen-2.5-1.5B-Instruct2025.10 | 49.2 | 70.4 | 51.18 | 36.2 | 49.6 | 28.8 | 3.33 | 41.24 | 2.57 | |
| CoTModel=Qwen-2.5-1.5B-Instruct2025.10 | 46.8 | 69.2 | 53.54 | 36.2 | 50.6 | 28.6 | 3.33 | 41.18 | 2.71 | |
| MacNetModel=Qwen-2.5-1.5B-Instruct2025.10 | 45.4 | 64.2 | 49.21 | 29.4 | 42 | 26 | 0 | 36.6 | 4.57 | |
| AgentVerseModel=Qwen-2.5-1.5B-Instruct2025.10 | 45.2 | 69 | 50.39 | 27.8 | 38.2 | 24 | 0 | 36.37 | 4.86 | |
| G-DesignerModel=Qwen-2.5-1.5B-Instruct2025.10 | 42.2 | 61.4 | 44.48 | 24.2 | 40 | 22 | 0 | 33.47 | 5.86 | |
| AutoGenModel=Qwen-2.5-1.5B-Instruct2025.10 | 11.6 | 69.4 | 28.74 | 5.4 | 12.2 | 5.2 | 0 | 18.93 | 6.06 |