Mathematical Reasoning on MATH lighteval (Conditional Local Accuracy, Overall Accuracy)
98.4Overall AccuracyCloud LLM
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Cloud LLM2025.09 | 98.4 | — | |
| OursModel=Qwen2.5-1.5B2025.09 | 80.4 | 72.6 | |
| OursModel=Llama-3.2-3B2025.09 | 79.5 | 72.2 | |
| Task-Tuning&RouterModel=Qwen2.5-1.5B2025.09 | 70.9 | 61.8 | |
| Task-Tuning&RouterModel=Llama-3.2-3B2025.09 | 69.4 | 64.9 | |
| Task-Tuning&Naive OffloadingModel=Qwen2.5-1.5B2025.09 | 67.2 | 56.3 | |
| Collaboration-Aware TuningModel=Llama-3.2-3B2025.09 | 66.8 | 60.2 | |
| Task-Tuning&Naive OffloadingModel=Llama-3.2-3B2025.09 | 65.1 | 51.6 | |
| Collaboration-Aware TuningModel=Qwen2.5-1.5B2025.09 | 61.5 | 54.1 | |
| Task-Tuning OnlyModel=Qwen2.5-1.5B2025.09 | 56.1 | 56.1 | |
| Task-Tuning OnlyModel=Llama-3.2-3B2025.09 | 51.2 | 51.2 |