Mathematical Reasoning on MATH 500 (Conditional Local Accuracy, Overall Accuracy)
97.3Overall AccuracyCloud LLM
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Cloud LLM2025.09 | 97.3 | — | |
| OursModel=Qwen2.5-1.5B2025.09 | 81.6 | 75.1 | |
| Task-Tuning&RouterModel=Qwen2.5-1.5B2025.09 | 72.2 | 64.9 | |
| OursModel=Llama-3.2-3B2025.09 | 68.6 | 56.6 | |
| Task-Tuning&Naive OffloadingModel=Qwen2.5-1.5B2025.09 | 67.4 | 55.4 | |
| Task-Tuning&RouterModel=Llama-3.2-3B2025.09 | 62 | 45.7 | |
| Collaboration-Aware TuningModel=Qwen2.5-1.5B2025.09 | 61.2 | 61.2 | |
| Collaboration-Aware TuningModel=Llama-3.2-3B2025.09 | 59.6 | 43.7 | |
| Task-Tuning&Naive OffloadingModel=Llama-3.2-3B2025.09 | 59 | 41.8 | |
| Task-Tuning OnlyModel=Qwen2.5-1.5B2025.09 | 54.8 | 54.8 | |
| Task-Tuning OnlyModel=Llama-3.2-3B2025.09 | 43 | 43 |