Mathematical Reasoning on AGI-Eval Math (Conditional Local Accuracy, Overall Accuracy)
94.7Overall AccuracyCloud LLM
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Cloud LLM2025.09 | 94.7 | — | |
| OursModel=Qwen2.5-1.5B2025.09 | 73.4 | 64.6 | |
| Task-Tuning&RouterModel=Qwen2.5-1.5B2025.09 | 69.2 | 58.7 | |
| Task-Tuning&Naive OffloadingModel=Qwen2.5-1.5B2025.09 | 68.3 | 51.6 | |
| Collaboration-Aware TuningModel=Qwen2.5-1.5B2025.09 | 66.9 | 55.3 | |
| OursModel=Llama-3.2-3B2025.09 | 64.5 | 59.7 | |
| Collaboration-Aware TuningModel=Llama-3.2-3B2025.09 | 58.9 | 43.9 | |
| Task-Tuning&Naive OffloadingModel=Llama-3.2-3B2025.09 | 58.7 | 45.7 | |
| Task-Tuning&RouterModel=Llama-3.2-3B2025.09 | 53.8 | 35.1 | |
| Task-Tuning OnlyModel=Qwen2.5-1.5B2025.09 | 51.8 | 51.8 | |
| Task-Tuning OnlyModel=Llama-3.2-3B2025.09 | 45.5 | 45.5 |