Mathematical Reasoning on AMC23 (Conditional Local Accuracy and Overall Accuracy)
97.5Overall AccuracyCloud LLM
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Cloud LLM2025.09 | 97.5 | — | |
| OursModel=Qwen2.5-1.5B2025.09 | 57.5 | 42.9 | |
| Task-Tuning&RouterModel=Qwen2.5-1.5B2025.09 | 55 | 39.3 | |
| OursModel=Llama-3.2-3B2025.09 | 52.5 | 35.7 | |
| Task-Tuning&Naive OffloadingModel=Qwen2.5-1.5B2025.09 | 50 | 32.1 | |
| Task-Tuning&RouterModel=Llama-3.2-3B2025.09 | 46 | 25 | |
| Task-Tuning&Naive OffloadingModel=Llama-3.2-3B2025.09 | 45 | 27.5 | |
| Collaboration-Aware TuningModel=Qwen2.5-1.5B2025.09 | 42.5 | 28.6 | |
| Collaboration-Aware TuningModel=Llama-3.2-3B2025.09 | 42.5 | 21.4 | |
| Task-Tuning OnlyModel=Qwen2.5-1.5B2025.09 | 35 | 35 | |
| Task-Tuning OnlyModel=Llama-3.2-3B2025.09 | 27.5 | 27.5 |